聊天机器人的黄昏

聊天机器人的黄昏

原副标题:How work changes along the exponential —— 工作如何沿指数曲线变化

如果你觉得 AI 的一切都在加速,那你很可能是对的。美国几家顶尖 AI 实验室推出更强模型的速度,比以往任何时候都快(尽管政府干预暂时切断了两个最强模型——Claude Fable 与 GPT-5.6 的访问)。

但变化的不只是发布节奏。证据还表明,能力本身的提升也在加速(尽管前沿依然起伏锯齿,AI 在很多地方仍然很弱)。这一点在”AI 能完成多少真实工作”上看得最清楚。已有几个不错的评测试图衡量:单次提示,AI 能完成相当于人类多少小时的工作。最有名的两个——METR 与英国政府官方的AI 安全研究所——估算的都是 AI 用一句话指令能替代多少程序员的人时;GDPval 则请专业评审,把人类专家和 AI 在许多领域的表现做直接对比。这些曲线的上扬速度,都超过了指数。

做类似实验的还有 Epoch:他们最近发现,Opus 4.7 独自连续工作 14 小时,就造出了一个软件包——人类工程师要做 2 到 17 周(token 成本 251 美元)。再说一遍:AI 系统并非无所不能,运行成本也不总是低廉,但它们的进步速度确实快得惊人。我自己的实验里也看到,Fable 能连续自主工作 9 小时,完成那些需要一整个团队花一周以上才能做完的复杂软件项目。

到目前为止,我谈的都是最前沿的模型——“智商”最高的那批,出自三家美国公司:Anthropic、OpenAI 与 Google(Google 已经好久没发新模型了)。但还有第二梯队:通常落后前沿 6 到 12 个月,全部来自中国。这些是开放权重模型,发布后任何人都能使用、修改(不像前沿的专有模型),所以运行成本很便宜。它们也在沿自己的指数曲线爬升,只是落后于美国模型。在我画的一张 AI 性能图上——测试叫 AA-Briefcase,模拟的是一场长达数周、需要多种分析能力的复杂咨询项目——开放权重模型沿着自己的指数曲线走,在美国闭源模型之后。

但抽象的曲线只能说明一部分问题,还会掩盖前沿的锯齿状(以及一个事实:开放权重模型虽然令人印象深刻,实际表现常常不如基准测试显示的那么强)。想获得真正的洞见,得亲自在不同场景里试用 AI,并严格评估它在你关心的领域里到底有多好。举个有趣的例子:我设计了一个测试,让 AI 们建造一个随时间演变的交互式港口模拟。所有结果都可以点这里试玩。我觉得它呈现了一个有趣的视角:不同的模型在设计、风格取向甚至判断力上能差多少。当系统能连续做越来越长的任务时,这些基准测不出来的因素会变得越来越重要。

AI 的用法正在改变

随着 AI 能做的任务越来越长,人们用 AI 的方式也在变。直到最近,主流用法还是”协同智能”:你让 AI 做一件事,检查结果,再让它做下一步。靠精心的提示词和人类的专注,你能引导 AI 完成复杂而长期的任务。

这个方法现在仍然常见、仍然有用,但它正越来越少地成为”有价值的工作”所采用的用法。能长时间运行、聪明、能自我修正的 AI 系统不需要人类持续干预,它要求的是另一种工作方式(这也是我的新书《Co-Existence》的主题,欢迎预订)。而且和聊天机器人不同,智能体还带着额外的”装备”:给 AI 提供工具和行动环境的脚手架(harness),以及为智能体而生的应用,比如 Claude Code 或 OpenAI 的 Codex。结果是:模型本身不断增强的能力,还能被一个好的脚手架或应用再放大一轮。

于是,工作越来越变成”把工作分派给智能体”,而不是”和聊天机器人一起干”。OpenAI 与一批学术经济学家做的一项联合研究,显示了这件事在 OpenAI 内部发生的速度。关键的是:用智能体的不只是程序员,法务、HR 和其他非技术职能的采用率几乎一样高。OpenAI 可能是煤矿里的金丝雀——它今天的样子,就是别处工作的明天。

现在的 OpenAI,工作越来越像在管理 AI:四分之一的员工每周同时跑着至少四个智能体。当写代码在专用脚手架和应用里被 AI 接管,其他岗位也开始像程序员一样干活了——而且干得不差。另一项针对 Claude Code 用户的研究发现:软件工程师和其他职业在真正用 Claude Code 做代码任务时,成功率差不多。

真正决定成败的不是用户的职业,而是他们的专业功底。某个领域经验越丰富的人,用 Claude Code 在该领域就越成功;更有意思的是,他们从每次提示里榨出的有用产出也越多。

我们正从”非专家用聊天机器人补短板”的世界,走向”专家用智能体出活”的世界。而用好智能体的最佳姿势,是把自己当成管理者。

一个时刻

身处指数曲线上,意味着固定窗口内的变化一次比一次大。如果你的组织在 2025 年冬天之前写过 AI 规划,它描述的是一个”能做几小时工作、出错率还不低”的系统;几个月后,一句话提示就能换来十六小时以上的工作量。这就是为什么 AI 总让人感觉在”突变”:明明是图上的一条曲线,我们却在内部一次次经历能力的稳定翻倍,体验成了一连串的冲击。我们很不擅长从指数内部感受指数——而我们现在就在里面。

我觉得,这也比”炒作论”更好地解释了 AI 周围的动荡。AI 要成为真正的网络安全威胁,“突然之间”就成了,于是各国政府最高层仓促出台临时政策;市场先是打折”AI 会不会颠覆某个商业模式”,直到”突然之间”它真能了,股价随之剧烈波动。这些踉跄被解读为”这是个不成熟的领域,早晚会稳定下来”。我不这么看,短期内它稳定不下来。这种不稳定,正是”按人类速度(更糟的是按委员会速度)运转的机构”,去追踪一条”本质上非人类”的能力曲线时必然发生的事。只要我们还在某种指数上,差距就只会越来越大。


备注:译文保留原文有价值的外链(METR、英国 AI 安全研究所、Epoch、AA-Briefcase、港口模拟试玩、新书《Co-Existence》);原文内转引的两项研究的 Substack 跳转链接未保留原文目标;末尾的订阅/付费推广页脚未译。


✍️ 出处

1 / 1
← 滑动或点击两侧翻页 →