作者:Packy McCormick、Markie Wagner
时间:2026 年 06 月 11 日
原文:
AI 的承诺在于,它会把业务变成软件,让业务能够通过数百万次微小迭代不断演化。那些美好、理想而复杂的东西,只能在漫长时间里的大量试错之后出现。完美无法被凭空建造,只能在不断试错中被发现。
资本主义,本质上是一场组织层面的进化。数以百万计的企业在市场中竞争,拿出它们认为客户会需要的产品和服务。有些企业繁荣壮大,有些企业走向死亡。每家公司内部也在持续演化:人员来来去去,一次实验变成流程,流程沉淀成一张隐性知识之网;新产品被推出,旧产品被淘汰。正是这种持续演化,让我们拥有了今天的生活水平;未来世代回看今天,也会觉得我们仍然相当原始。
我离开研究世界,是因为我觉得那不是最值得攀登的山头。于是我走进美国各地,直接去做具体的工作。只有先弄清楚工作本身,我才能理解怎样让计算机去做这些工作,进而让人类能够指挥计算机,推动工作不断演化。
在真正走出去之前,我已经有所怀疑;一路看下来之后,我更加确信:到目前为止,市场实现 AI 的方式是错的。它还不是终局。这套方式太浪费、太健忘,也太不精确。为了换来这点认识,我简直像是在撒哈拉沙漠里和恶魔搏斗了一场。
Tokenmaxxing 显然走不远
所谓 tokenmaxxing,字面意思就是尽可能最大化个人或组织消耗的 token 数量。企业用排行榜追踪 token 消耗,再用小奖品奖励使用量最高的人。这是一场集体幻觉,像是一种商业化的 AI 精神错乱。
tokenmaxxing 是一个实验室培养出来的超级 meme,而且传播效果可能比这些 AI 实验室原本期待的还要好。
可以这样想象:Anthropic 和 OpenAI 分别推出了 Claude Code / Cowork 和 Codex 这类 Agent 产品。这些 Agent 基本上就是 AI 模型公司派进客户公司里的“员工”,还拿到了一张没有消费上限的公司信用卡。按照 tokenmaxxing 的逻辑,它们花得越多,就说明干得越好;而它们真正花钱的对象,正是它们的实际雇主,也就是 AI 模型公司。
比如,Anthropic 把一批 Agent 送进 KPMG。KPMG 承诺一定的使用量,以换取折扣,也就是 token commits。KPMG 的员工被鼓励用 Agent 做任何他们能想到的事情,各种仪表盘也随之出现。于是,这些可以被理解成“拿着 KPMG 无限额信用卡的 Anthropic 数字员工”的 Agent,开始尽情消耗 token,把账单刷到痛快为止。那些指挥 Agent 使用最多 token 的员工,则被表彰为 AI Innovators。
当然,也有人意识到这是一场幻觉。他们会问:“可是这些 Agent 到底有没有做出什么有用的东西?它们是不是只是在做仪表盘?能不能请谁给我看一个真正有用的 Agent 产出?”但这些少数清醒的人,很快会遇到一句杀伤力极强的反驳:“Skill Issue。”
他们被告知,有些人正在用 Agent 构建极其有价值的东西。这有点像有人说自己在夏令营有一个超级火辣的女朋友,只是你从来没见过。如果你自己做不到同样的事,那好吧,欢迎来到 Permanent Underclass。
有一段时间,所有人都信了。市场激励公司消耗 token,于是董事会激励管理层消耗 token,管理层激励经理消耗 token,经理又激励员工消耗 token。没有人有动力站出来说,这些 token 并没有在做什么有用的事情。
我总是在和这些人聊天,而每家公司都会出现某个版本的同一段对话。负责 AI 团队的人会说:“这个季度我们取得了巨大进展。我们花了 5000 万美元买 token。”然后所有人点头、鼓掌。“使用量上来了。我们做了 3000 个 Agent。我们交付了 1000 万行代码。”你听完只想问:什么?然后我会问:“那个反欺诈 Agent,你们测过准确率吗?”对方说:“测了……大概 50%。”可人能够做到 99% !
但是模型还在进步,所有人都在 tokenmaxxing,而你也不想显得像一个抗拒技术的人。于是,你继续懒散地把 Agent 扔向所有问题,然后指望它们自己学会。
顺便说一句,这一切发生的时候,正好也是 AI 模型公司从订阅制收入转向按量消耗收入的时候,企业几乎没有时间准备。
所以,token 使用量,以及由此带来的 AI 模型公司收入,出现抛物线式增长,也就一点都不奇怪了。
最终打破这场幻觉的,是 Uber。上一轮周期里,Uber 曾是 VC 补贴需求的标志性公司。它的 CTO 说,公司到 4 月就已经烧完了 2026 年 Claude Code 的 token 预算。5 月,Uber COO 又说,公司越来越难证明 AI 支出的合理性,因为 AI 消耗和实际交付功能之间的联系“还不存在”。
接下来发生的事情,有点像电影《贱女孩》里的一个场景:Tina Fey 问学生们,如果她们觉得自己曾被 Regina George 伤害过,就请举手。先是一只手举了起来,然后所有人的手都举了起来。
有位顾问说,他的客户不小心在 Claude Code 上烧掉了 5 亿美元。Amazon 关闭了自己的 AI 排行榜。Legora CTO Jacob Lauritzen 告诉 Harry Stebbings,token 排行榜“会导致 tokenmaxxing,也就是人们为了显得自己做得好,就去白白烧 token。这是一种非常愚蠢的做事方式。”Ramp 的 Veeral Patel 把它称为 Token Casino:“有用的软件,被包裹在一种让花钱看起来像进步的机制里。它从最古老的把戏开始:把钱抽象掉。”Palantir CEO Alex Karp 对 TBPN boys 说,tokenmaxxing 就像“一种色情成瘾”。
甚至连 Sam Altman 这个重要的 token 供应商本人,也在 CNBC 上承认:“你会听到一些公司说,‘我在 AI 上花了很多钱,我知道一些很棒的事情正在发生,但我也知道这里面有大量浪费。而且,你知道,什么时候……我要等多久,才能真正看到它体现在收入里?我要等多久,才能真正把成本控制住?’” 他承认,这已经变成了一个“巨大问题”。
问题在于,企业一直把注意力放在最大化 token 上,并假设 token = 价值。
每个周期都有自己的愚蠢指标。19 世纪中期,市场把铁路里程当成未来垄断及其收益的代理指标,于是铁路公司竞相铺轨,很多线路甚至和竞争对手走在同一条路线上。21 世纪初,市场想要的是 eyeballs,也就是眼球,于是互联网公司拼命吸引眼球,再把它们端上广告主的餐盘。2010 年代,市场想要的是收入总额,于是 WeWork 这样的公司交出了好看的收入总额。
这一轮周期的愚蠢指标,就是 tokenmaxxing。
这并不意味着 token 没有价值。Cornelius Vanderbilt 的 New York Central 最终变得非常有价值,Pennsylvania Railroad 也是如此。Google 和 Facebook 把眼球转化为现金流的能力,可能比历史上任何人把任何东西转化为现金流的能力都强。Uber 最后也把收入增长转化成了市场主导地位,并在 2025 年形成了 100 亿美元自由现金流。
问题始终在于:这个东西能不能产生回报?
对于 token 来说,问题就是:你的 Return on Tokens,也就是 ROT,到底是多少?
Return on Tokens
当你投资一台新机器时,你会期待它产生回报。当你招聘一名员工时,你也会期待他产生回报。商业的过程,就是不断做出大大小小的投资,并期待这些投资创造出超过成本的价值。
token 也应该接受同样的标准。
Return on Tokens = (产出价值 - token 成本)/ token 成本 x 100由此看,提高 ROT 有两条路径:你可以用 token 创造更有价值的东西,也可以减少 token 消耗。理想状态下,是用更少的 token 创造更多价值。
企业现在首先关注的,是减少消耗。原因很简单:相比衡量产出价值,衡量支出要容易得多。
当 tokenmaxxing 的幻觉被打破后,更冷静的人开始讨论 “routing”,也就是模型路由,把它作为降低成本的办法。需要高强度推理的事情,用 Anthropic 和 OpenAI 最好的模型;大部分普通工作,则交给便宜的中国开源模型。Coinbase CEO Brian Armstrong 最近的公开说法,就是这种逻辑的典型例子。
你也可以在 OpenRouter AI Model Rankings 里看到这种变化。转向中国模型的趋势,实际上和按消耗计费的普及几乎同步出现。当然,这里的用户本来就是一个自我筛选过的群体,他们已经在思考怎样把不同任务路由给合适的模型。其他人现在也在匆忙做同样的事。
这是一个不错的开始。但让 Agent 消耗 token,不管是美国模型的 token 还是中国模型的 token,从零开始推导所有事情,也仍然到不了终局。
因为你知道什么比中国模型还便宜吗?代码。
代码,那种古老而朴素的确定性代码,不仅便宜,而且更适合大多数具有经济价值的工作。这个教训,我们其实早就学过。
过去,公司雇佣人类来完成各种重复性任务。在 “computer” 变成数字机器之前,computer 指的就是做人肉计算的人,也就是计算员。
When Computers Were Human, NASA
大约半个世纪前,我们开始把人类做的重复性任务交给软件,比如计算导弹轨迹,或者计算一家公司的利润。代码比最可靠的人类计算员还要可靠。它不会犯错,能够立刻给出答案。无论在世界上的哪个地方、哪个时间,只要你在 Excel 表格中把同样的数字和同样的公式输入到同样的单元格里,它就会吐出同样的数字。
然后,我们有了 Agent,却忘掉了这个教训。我们开始觉得,既然所有人都在这么做,那就应该把这些“类人”的东西扔向所有问题。Agent 在某些事情上确实很强,但在很多其他事情上,它们并不适配。
企业没有从 token 上获得正向 ROT,并不奇怪。所有能做的仪表盘都已经被做成了仪表盘,现在它们又开始派 Agent 去做本来属于软件的工作。
当然,也可以提出一种说法:很多公司之所以拿不到正向 Return on Tokens,是因为它们还不知道怎样使用 token,或者还没有把公司重新架构成 AI 原生的形态。或许也正因为如此,Anthropic 和 OpenAI 都推出了咨询子公司,帮助企业更好地部署 token。确实也有一些在 AI 时代诞生的创业公司,看起来非常有效地使用了 token,这一点也体现在它们超音速般的收入增长上。如果旧经济企业做不出 ROT,那好吧,这就是破坏性创新。
虽然不同公司部署 AI 的能力确实有差异,但我们认为,负 ROT 背后存在更根本的结构性原因:对大多数工作来说,Agent 是错误的架构。
Agent 也走不通,至少对大多数工作来说
Agent 的负 ROT,有三个结构性原因。
第一,Agentic 架构无法以真实经济工作所要求的“几个 9”的质量水平,完成长时间运行的工作。
Agent 依赖即兴发挥。它们被一次次重新派到重复性任务上,好像每天都是上班第一天,这会伤害持续稳定的准确性。对于新功能、原型或仪表盘,80% 的准确率也许可以接受。但对于支撑经济运转的真实重复性工作,比如欺诈检测或承保决策,80% 的准确率等于 0% 可用。
第二,工程师不知道该构建什么,因为他们并不亲自做那些工作。
我们正在讨论的大多数流程型工作,通常由两部分组成:一部分是书面规则,Agent 可以读取;另一部分则是大约 3000 条存在于人脑中的隐性规则和子规则。这些知识分散在全国各地的办公室里,远离工程师在旧金山的办公桌。AI 只能演化它能够触及的东西,这也是为什么它在写代码上表现很好,却在企业里很大程度上没能做出真正有用的事情。
第三,原罪在于没有目标。
如果人没有目标,Agent 也就没有目标,最后整个系统什么结果也达不成。没有一个清晰的目标,代码无论是人写的,还是 Agent 生成的,最终都会退化成一团垃圾,因为没有一种力量去评估什么是好、什么是坏。
从偷懒的角度看,Agent 有一个很诱人的地方,尤其是在组织还鼓励你多花 token 的时候:你可以在自己并不确切知道要解决什么问题的情况下,直接把 Agent 放出去。它可以围绕一个模糊指令转上一阵,带回一个还不错但不完美的东西,然后再出去继续转。
这个过程会推动更多 token 消耗,却不创造任何价值。这是一条通向负 ROT 的快车道。
人们正在为 Agent 寻找新的事情可做,背后的假设是:AI 对代码做过的事,也会对其他一切事情重演。但它未必需要这样。
有相当多的工作,最适合的完成方式仍然是朴素的老式代码。过去的挑战在于,直到最近,我们还没有足够多的工程师,把每家企业所做的每一件事都变成代码,并随着情况变化不断更新。现在我们有了。AI 让写代码变得微不足道。所以,只要我们能把知识从人的脑子里取出来,就能把业务变成代码。
AI 应该做编译器,而非运行时
基本上,软件的工作分成两步:思考和执行。
第一步是思考。你拿到一段软件应该实现的目标和需求,然后把它编译成计算机可以运行的代码。
第二步是执行,而且是一遍又一遍地执行。每当这段软件需要完成那件事时,代码就会以低成本、可预测,或者说确定性的方式运行。
计算机科学对编译器有精确定义,但你也可以把一家软件公司,或者一名软件工程师,理解成一种编译器。他们接收目标和需求,把它们转化成代码。然后,客户购买他们构建出来的代码,一遍又一遍地运行。这就是零边际成本软件业务的美妙之处,也是为什么公司可以把耗费数百万美元开发出来的软件,以每月 20 美元的价格卖出去,同时仍然获得令人垂涎的利润率。
今天,大多数人思考和使用 Agent 的方式,是让它们同时替代软件公司和软件本身。这种理解是错的。
Agent 应该替代软件公司。它们应该接收用英语,或者任何其他语言表达的目标和需求,然后把它们转化成可以一遍又一遍确定性运行的代码。
思考很贵,但很少发生。执行很便宜,而且会一直发生。
Agent 应该负责思考,代码应该负责执行。
对于大多数经济工作,你想要的模式应该是:用人类弄清楚规则,用 AI 把规则变成代码,然后让这些代码以接近零 token 成本的方式一直运行。只有当规则发生变化时,才把 AI 再请回来。
为什么要用 prompt 去做两个数字相加?写一行 Python 就行了,兄弟。
当前 AI 实施中的 Thinking-Doing Ratio,也就是思考-执行比,大约是 1000:1。这并不奇怪。旧金山是一个“思考”之城。Anthropic 的帽子上就只写着一个词:“thinking”。
Anthropic thinking cap + OpenAI Token Appreciation Award, Business Insider
硅谷构建 AI 时,假设工作主要是思考。但工作主要是执行。
聊天是少数例外,因为在聊天里,你真的不知道下一步会发生什么。所以,也许客户支持业务仍然会持续消耗 thinking tokens,尽管即使是客户支持 Agent,也会把复杂问题转给人类。除此之外,企业里几乎没有什么工作像是在持续即兴发挥。
所以,我们现在用 Agent 来执行,但 Agent 是执行领域里的 BlackBerry。它可能是一代过渡性设备,却不会是五年后企业运行大多数工作的地方。那些工作会在 Agent 写出来的确定性代码里完成。
Agent 的角色,是编译成代码,而非每天运行并执行工作。这也意味着,它更像资本支出(CapEx),而非运营支出(OpEx)。你以为未来会由 AI 运行的东西,实际上都会由代码运行。
所有人都以为,世界即将发生的变化是 AI 会变成一个人。但真正的变化,是业务会变成一段软件。
这就是我们在 Poetic 正在构建的世界。
把业务变成会演化的软件
我们正在构建 tokenmaxxing 的解药:一种能够自我 tokenminn 的软件。
Poetic 是一种新类别的软件:像 AI 一样自适应,像代码一样可靠。
我们把 AI 当作编译器。我们会先吸收一家企业已经写下来的所有流程,然后去内布拉斯加、普罗维登斯,或者任何真正发生工作的地方,坐在员工身边,一遍又一遍地问:“你刚才做了什么?”“你为什么这么做?”通过数百次这样的追问,学习每家公司赖以运转的数千条隐性规则。然后,我们把这些规则变成代码。
代码就是运行时。当世界保持不变时,这些代码每次都执行完全相同的步骤。当世界发生变化时,它会学习、重新生成、围绕目标进行自我测试,然后运行新的代码,直到世界再次发生变化。
结果是,token 使用量降低 100 倍,同时在复杂任务上达到多个 9 的准确率。换句话说,你花出去的每一个 token 都能多做 100 倍的事情,而且做对。
产出的价值会上升,因为 Poetic 做的是你的企业确实需要反复完成的事情。token 成本会下降,因为 Poetic 只在世界发生变化时使用 token。两者结合起来,Poetic 能够产生清晰、可衡量的 Return on Tokens。
我们今天已经在为 AIG、SoFi 和 Chime 这样的公司做这件事。AIG CEO Peter Zaffino 说,Poetic 已经“在持续数小时的流程中实现了 99% 以上的质量结果,交付了真实的企业价值”。
这些公司的领导者相信我们所相信的事情:每一家企业都必须以软件企业的方式被重新创立。未来十年的故事,就是这些新企业的开始。有些会是真正从零开始的新企业;另一些则是已经存在数百年的企业,但它们有勇气重新发明自己。
所有人都在谈论,工厂只有围绕电力重新配置之后,才能真正受益于电力。但他们接着给出的 AI 版本,往往变成了“所以,那些围绕大量消耗电力来解决问题的新企业会赢”。关键动作其实是把业务重构成代码。
要做到这一点,需要脚踏实地的地面战。你必须深入企业的内部,无论它们在哪里,理解它们如何运转,并把它们的逻辑迁移进程序里。我们需要有人真的走到明尼苏达去,问一句:你们这些人一天到晚到底在干什么?
我们团队的大多数人都是工程师,其中很多来自 Palantir。他们会一次在客户现场待上数周,向客户学习,钻进最细碎、最具体的细节里。
“Social Engineer” 这个词名声不太好,尤其在安全语境里容易让人想到社会工程攻击。但相比那些整天坐在桌前给 Claude 写 prompt 的工程师,他们才是最社会化的工程师。理解人、理解商业、理解 AI 的工程师,将会统治世界。如果这听起来像你,欢迎加入 Poetic。
这是一份艰苦的工作。但 AI 时代到目前为止最大的错误,就是相信任何值得做的事情都可以很容易。
这件事值得做。也是我从记事起就一直想做的事。因为支撑我们世界运转的所有机构,每一家企业、每一个政府,都在做大量并不合理的事情,运行速度远低于应有水平,并且让整个系统变得黏滞。
我们的目标,是为每一家企业发现完美流程:一套为了实现你的目标而存在的理想计划和步骤。随着世界演化,这套流程也会演化。
AI 的角色并非 “Agentic”,也不该一边走一边即兴发挥。它是一种进化力量:改变、测试、评估哪一种计划最成功,并坚持执行,直到更好的计划出现。
归根结底,这就是业务本身。一段活着的、不断演化的软件,不断重构、测试、评估自身,以所能想象的最快速度冲向理想形态。人类存在的意义,是定义什么是好;至于如何抵达那里,交给系统去演化。人类塑造行为,指挥行为。
通过在生产环境中运行,系统会获得一份关于已经发生之事的记录。每一场争议、每一笔承保案例、每一次保险理赔,都留下了逐步发生的过程。因此,每一次流程改变都变得可以测试。关于“如果怎样会怎样”的问题,经过几分钟回测就能得到答案。把两种场景都放进影子环境里运行,比较结果,然后决定哪一个更好。
当影响完全可知时,风险就很小,因为你确切知道本来会发生什么。改变于是变成一个选择。接下来的选择则是:哪一种结果更理想?流程负责人,也就是负责确保流程实现上层目标的人,只需要做出选择。
要做出改变,你必须知道改变的影响。生成代码很容易,难的是知道运行代码之后会发生什么。运行数月之后,你就可以问这样的问题:“如果我们批准所有 25 美元以下的争议,会怎样?”然后在几分钟内得到答案。
从那时起,通向最美流程的爬坡就开始了。专家们开始实验,提出各种 “what-if” 问题。当人类不再是瓶颈之后,他们就可以开始真正搜索。
这就是终局。
每一家企业不仅是一段软件;它还是一段不断编辑、测试、评估变化的软件。它以尽可能高的帧率演化,攀向自己最正确的形态。所有能量都用于演化,用于寻找规则的理想形态。
我们不使用 token 来运行业务。我们使用 token 把业务变成代码,并让它演化。我们 tokenminn,从而 ROTmaxx。
在数十亿年的时间里,我们从海洋黏液出发,经过试错,演化成鱼、蜥蜴、田鼠、猴子和人类。
我们不想再等数十亿年,才让业务演化出各自多样而理想的形态。而 Agent 不会把它们构建出来。你无法直接造出蝴蝶。
美好、理想而复杂的东西,只能通过演化出现。我想加速这个过程,看看我们究竟能走多远。







