从写代码到问问题:2026年,AI如何重构数据科学工作流
·
别指望AI自己懂业务,把经验写成“护栏”
初级智能体最容易翻车的地方,往往是那些老手看来“理所当然”的细节。比如表关联时忽略粒度,一跑直接爆出笛卡尔积,账单瞬间爆炸。
这种低级错误,AI自己学不会,得靠人把规矩定死。
我们现在通行的做法,是把团队踩过的坑封装成可复用的Skill。比如下面这个数据质量校验的模板:
class DataQualitySkill:
"""复用型数据校验规则,专治各种数据脏乱差"""
def check_null_rate(self, df, threshold=0.1):
null_rates = df.isnull().mean()
return null_rates[null_rates > threshold].to_dict()
def validate_join_keys(self, left, right, keys):
for key in keys:
assert left[key].is_unique, f"左表{key}存在重复键,小心笛卡尔积"
assert right[key].is_unique, f"右表{key}存在重复键"
return True
# 注册到Agent工作流中,强制AI执行前过一遍
agent.register_skill("data_quality", DataQualitySkill())
把业务经验写成代码级的“护栏”,AI才不会在复杂任务里跑偏。
最近智源研究院出的趋势报告也印证了这一点:那些真正能跑通商业闭环的MVP,底层几乎都绑着领域规则引擎。
没有规则托底,自动化就是盲人摸象。
四、 岗位不会消失,但“问问题”的能力会被重新定价
AI能一眼看出“2020年后用户活跃度断崖式下跌”,但它永远猜不到背后的原因是“疫情居家导致场景切换”。机器擅长找相关性,人类才懂因果和语境。
斯坦福和麦肯锡联合做过推演,未来数据科学家的核心价值早就不是写代码了,而是三件事:
- 把模糊的业务抱怨翻译成可验证的分析命题
- 设计严谨的实验框架
- 结合行业常识去解释数据异常。
至于“会不会被取代”的争论,其实两边都没错。AI确实能吞掉80%的重复性清洗和建模工作;但美国劳工统计局(BLS)依然预测到2034年,相关岗位会有36%的增长。
缺口在哪?就在“定义问题”和“校准价值”上。
只会写SQL的会被淘汰,懂业务、能拆解复杂命题的,反而会更抢手。
五、 自动化≠甩手掌柜,隐性成本和安全边界
上了智能体,不代表就能当甩手掌柜。2026年企业踩过的雷,基本集中在三块:
- 权限与数据安全:授权AI访问云端数据时,“最小权限原则”是铁律。别为了图方便开全量读写,数据泄露的代价远超效率提升。
- 幻觉与过程黑盒:有研究显示,九成以上的隐私合规项目只盯着输入输出,却忽略了AI中间的推理路径。关键结论必须人工复核,尤其涉及资损或合规的环节,别省那一步。
- 隐性成本失控:自动重试机制跑起来很爽,但日志膨胀、Token消耗和临时存储的账单,往往月底才让人倒吸一口凉气。成本监控必须跟自动化流程同步上线。
选平台时,别被“全自动”“零代码”的营销话术忽悠。优先挑那些支持“人机协同”、执行过程可追溯、能白盒化查看决策链的工具。
更多推荐



所有评论(0)