如何评价当前的 AI Agent 落地效果普遍不佳的问题?
我看 Coding Agent 落得挺好的,已经完全转化为生产力了,现在谁写代码还纯古法。教师、各种文案工作,落地落得也挺好的。
所谓 AI Agent 落地不佳,主要指的还是企业级场景。简单地说,现在 AI 给个人用,作为个人生产力的补充,是够的;但是真正落到大工业、大数据的生产力,可不是现在的 AI 搞得定的。
代码写错了,CI 可以验证;文案写得不好,领导改几句就完事了。你要是真敢把现在这坨充斥着幻觉的 LLM 丢进工厂的生产车间,丢进银行的金融分析,那分分钟挂在那里。
说白了,当前的 Agent 任务执行成功率不够高,而且不确定性强。代码是死的、可预测的,所以被广泛使用;但 AI 的行为是不可预测的,这是 LLM 本身性质决定的。生产级环境讲究的是但求无过,不求有功。
缺的那 20% 才是最关键的
我也参加过几个 Agent 的落地项目,基本上精度可以干到 70% - 80%,但是缺的那 20% - 30% 才是最关键的。说白了,一个工厂的熟练工人、工程师,跟头一次接触生产的新员工之间的差距,可能也就是这么大。
所谓行百里者半九十,在当前基模能力越来越强的今天,可能早已经不是夸张的说法,而是非常非常写实的了。
缺的那些健壮性、精度怎么补?说实话,不好补。我十分同意一个观点:不要着急搞通用型 Agent,先把各个小的细分领域的事情做好。
大而全不可能,小而精才是王道。
下一个雪球可能是数据领域
代码管理领域已经有非常成熟的解决方案了,Claude Code、Codex 一统江湖。AI 下一个阶段接管的领域是哪个?我认为是数据分析和数据加工领域,也就是大数据领域。
模型的编码能力和 Coding Agent 之所以强,是因为 21 世纪初开始的开源精神给互联网积累了大量可供训练的丰富语料。程序员们对于提高自己效率这件事情又是非常热衷的,以至于这个领域可以极快进入一种正反馈循环:越搞越快,雪球滚起来了。
这个球滚起来之后,下一个球就是数据领域了。
倒不是真要用企业数据去训模型,而是说,现在人类已经有了足够多的 Agent 工程基础,随便搞点什么 Agent 框架太简单了;而数据,又是代码和计算机最适合处理的东西之一,所以我认为数据这个雪球很快也要滚起来了。
不过到底要怎么才能滚起来?摸爬滚打了一段时间之后,我觉得有这么几个要素。
首先,一定要方便好用。拿自然语言就能处理东西,有个易用且健壮的前端。2026 年了,我要是再去指挥模型去看这表那表,这库那库,那我真不如用 Coding Agent 自己重新搓点日抛代码用。
然后,数据处理流程一定要有完整的记录。这个记录不光是为了保证可还原、可审计,类似 Git;它还是后续演化的基础。只有滚雪球才能快速促进发展,这个时代靠人力去调优是不可能的。
再然后才是效率和精度。
Coding Agent 一开始也不擅长写太多代码,也不擅长管理项目,也是从基模开始猥琐发育搞起来的,一步一步对着各种 benchmark 提升精度,搞上下文,搞 harness,慢慢搞起来的。目前看来,至少前三个雪球都不会少了这步。
想得多不如干得多。
最近就跟朋友尝试搓了一个数据工作台,感觉还挺好玩的,也碰了不少壁,但大体上感觉还是在正确的方向上走。
也欢迎感兴趣的人一起来搞:
搞成什么样子,只有天知道,摸爬滚打便是,实践出真知啊。