作者:Harry Wetherald
时间:2026 年 01 月 09 日
原文:
如果 AI 智能体真这么强,为什么还没“无处不在”?关于 agentic AI,我们已经听了一年多了:创业公司都在承诺,成熟厂商纷纷“转型”,LinkedIn 上更是挤满了各种思想领袖,绘声绘色地描述一个叫 Bob/Mary”的数字员工,如何替代整个团队。演示的确都很炸裂。AI 智能体显然能做出不少令人惊叹的事——但现实是:我们并没有看到它们大规模、稳定地落地。
我的判断是:
大语言模型(LLMs)+ LangChain 这类框架,让“做一个看起来像智能体的东西”在技术上变得很容易。
但要把它做成行为可预测、表现可靠、成本可控的产品,难度远超大多数人的想象。
真正好的智能体,往往高度专注在一个定义清晰、边界很窄的任务上(比如编程领域的 Cursor)。而这种“高度专用”背后需要的是海量工程:数据、流程、工具、评测、反馈闭环、以及对失败模式的系统性治理。
在交付压力下,很多团队会选择推出“通用型”智能体:听起来什么都能干、覆盖一堆用例。但一旦进到复杂的企业环境,它们往往达不到所需的可靠性门槛(Copilot 就是典型例子之一)。
于是团队开始依赖“前线部署工程师”(forward-deployed engineers,也就是实施/驻场顾问),给每个客户做深度定制,把产品能力的缺口用人力补起来。
最后,这些因素叠在一起,导致 2025 年出现了一波新的智能体浪潮——声势很大,但本质上并没有真正跑起来。要让智能体变得“可用”,最现实的路径是:先把一个狭义、明确的场景做深做透,而不是一上来就试图覆盖大量用例。
AI 智能体之所以让人兴奋,原因也很直接:它能在复杂、多步骤的任务里做推理;理解上下文;调用外部工具、收集信息、做判断;它不是照着预先写死的规则执行,而更像一名资深员工在“想事情”。
真正的麻烦在于:LLM 天生不确定。你问 Claude 或 ChatGPT 同一个问题,并不总会得到同一个答案。现在把这个不确定性放大一下:如果你把三十、四十次 LLM 调用串成一个链条,再叠加十来次工具调用,会发生什么?每一步都在引入新的不确定性;每一次工具调用都可能失败;于是决策树的分支数会快速、近乎指数级膨胀。让智能体强大的东西,同时也是它的负担:步骤越多,出错点越多;自主性越强,跑偏的方式也越多。
这正是智能体垃圾 Agentic Slop 的来源。任何人都可以拿一个现成的智能体框架,对准一个足够模糊的目标——比如“帮助安全团队”或“自动化 IT 工作流”——再接上十来个集成接口,标一个 10 万美元的价码,配上一名驻场实施顾问,勉强让系统“跑起来”。
根本性的错误只有一个:试图让智能体做太多事情。一个号称“什么都能干”的通用型智能体,实际上对任何事情都没有被真正优化。这就像雇了一个自称“精通商业”的咨询顾问——听上去很厉害,但一旦落到具体问题,几乎帮不上什么忙。真正优秀的 AI 智能体之所以难,是因为你必须把三个极其具体、也极其“脏”的问题解决掉。
第一,你要教会智能体如何围绕「你的特定任务」去规划和思考。
LLM 是通用推理引擎,但它并不会天然擅长某个垂直领域的真实问题。你必须把人类专家的解题路径“灌”进去:先看什么信息?会追问哪些关键问题?有哪些只有老手才知道、却从未被写进文档的隐性捷径?这通常意味着要和一线专家一起,花上几个月反复拆解、验证、迭代。
第二,你要为智能体提供正确的上下文与工具。
智能体的能力上限,取决于它能接触到哪些信息。完成一项任务究竟需要哪些数据?这些数据如何被稳定获取?又该用什么结构和粒度喂给模型,才能真的“可用”而不是“可见”?这里一旦做错,智能体就会在缺失关键信息的情况下,自信满满地输出错误结论;而一旦做对,你就不可避免地要和现有系统做深度耦合——不仅是 API 对接,更是对“什么是关键信息、该如何呈现上下文”的系统性工程设计。
第三,你必须为这个用例本身,重新优化成本结构。
一次任务里调用高端 LLM 四十次以上,成本很快就会失控;但如果换成更便宜的模型,错误率又可能飙升。这个取舍没有通用答案,只取决于任务本身的价值密度,以及“犯一次错”的真实代价。通用型智能体框架不可能替你完成这种权衡。
考虑到这是 2025 年最性感的职位头衔之一,这个判断或许有点刺耳,但在我看来,有一个非常清晰的信号可以用来识别一家公司是不是在卖 智能体垃圾:他们是否需要驻场实施顾问,才能让产品跑起来。所谓前线部署 forward-deployed,本质上只是一个更好听的说法,翻译过来就是:
“我们的产品并不能开箱即用,所以需要派昂贵的人类工程师到你现场做定制化工程。”
我完全理解公司为什么会这么做。定制化确实很难,每个客户的环境也都不一样。Palantir 已经证明过,“软件 + 服务”的模式是可以做成一家大公司的。但一个真正优秀、而且高度专用的 AI 智能体,本不应该依赖这一点。真正把功课做到位的公司——把深度的人类专家经验编码进系统,工程化正确的上下文,并围绕一个明确用例做系统级优化——理应能够交付一个第一天就能用的产品。
AI 智能体本身是极其惊人的。这项技术确实具备颠覆性,也正因如此,在 2025 年看到如此缓慢的真实进展,才会让人倍感挫败。除了少数几个领域(比如编程、客户支持)之外,我们今天基本仍停留在 AI 智能体的垃圾 slop 阶段:一半的市场在试图推出通用型框架,同时假装“专业服务”可以长期弥补产品本身的缺陷。
最终胜出的,一定是那些毫不留情地走向专用化的公司。先选定一个狭窄但高价值的任务,在这个任务上做到无可争辩的优秀,然后才考虑扩展;真正投入领域专业能力;和一线从业者一起,把专家的思考方式编码进系统;彻底解决上下文工程问题;搞清楚智能体真正需要哪些数据,并为此构建稳健的数据管道。交付那种真正“开箱即用”的产品。如果你还需要靠顾问才能让智能体变得有用,那就继续迭代,直到不再需要为止。真正能跑起来的智能体,一定是狭义的、专用的,并且为其具体任务做了深度优化的。
其他的一切,都是智能体垃圾 Agentic Slop。




