跳到主内容
皇冠体育

Fable 5.1超越人类却贵了2.5倍,NeoCognition给Agent进公司算了笔账

2026-09-19 · 宋雅婷 · 更新于 2026-09-20

各类大模型排行榜层出不穷,但榜单上几分的差距,在真实工作场景中究竟意味着什么,往往难以判断。

在 Artificial Analysis(AA)、Terminal-Bench 4.0 和 CursorBench 4.0 等测试中,Fable 5.1 与 Opus 5 的成绩仅有几分之差。然而,如果让它们进入同一家公司,使用相同的软件、学习同样的业务,并连续处理同一批账单,结果却截然不同:72% 对比 36%。

完成的任务数量,相差一倍。

这一结果来自 NeoCognition 最新推出的 ApprenticeBench。与常见的单项能力评测不同,该测试将 Agent 置于一家模拟建筑公司中,让其像新员工一样入职:阅读员工手册和历史资料,使用真实企业软件,并根据主管的反馈逐步掌握公司的业务规则。

ApprenticeBench 主页链接:https://apprenticebench.com/

Agent 并未针对这份工作接受专门训练。它需要边工作边从公司的历史数据和带教过程中学习。在这项评测中,Fable 5.1 和 GPT-6 Astra 分别取得了 72% 和 68% 的通过率,甚至超过了本次测试中表现最好的人类测试者(51%)。

Fable 5.1 和 Astra 显示出明显的能力跃升,超过了本次的人类测试者。图源:ApprenticeBench 博客(https://neocognition.io/blog/apprentice-bench/)

这也引出了一个更广泛的问题:如果 Agent 能够自行熟悉软件、学习业务,那么今天需要 FDE(前线部署工程师)为每家客户进行的部署和适配,未来是否也能交给 Agent 自己完成?

一份看似普通的会计工作,为何能拉开如此大的差距?对于正在训练下一代模型的团队而言,这些差距又意味着什么?

公司的规矩,

进公司才知道

会计学知识可以提前学习,但一家公司的具体做账方式、最近修改的政策,任何通用模型都不可能也不应该知晓。新员工入职后需要补习的内容,Agent 同样需要补习。

这便是 ApprenticeBench 的核心设计思路:Agent 进入一家模拟建筑公司,使用与人类员工相同的软件(Odoo)处理应付账款。入职时,它获得员工手册、软件教程和六个月的历史账单,随后连续处理 100 张新账单。在第一个月里,主管会逐单指导,之后仅在月底提供稀疏反馈。

从翻阅历史记录到逐步独立处理业务,Agent 经历了与新员工相似的学习过程。图源:ApprenticeBench 博客

在实际操作中才会发现,麻烦都藏在细节里——the devil is in the details。

在建筑公司的应付账款工作中,单位写错、保险过期、前任未交接清楚等情况并不少见。同一张账单,多个问题常常同时出现,需要来回沟通多轮。然而,现有的 benchmark 将这些真实工作中的麻烦全部省略了。同时,还有许多规矩不会被明确写下来。相同的支出描述,因为用途不同,可能归入不同的成本码(cost code)。Agent 需要从历史账单中自行琢磨,而不能仅凭名称猜测答案。

这些麻烦都被纳入了 ApprenticeBench。100 个任务经过两位合计拥有超过 30 年相关经验的专业人士独立验证,确认它们确实会在工作中发生,并且能够根据 benchmark 中提供的信息解决。

拥有 20 年经验的建筑业财务主管 Emilie F. 表示:“这些场景很真实。比如项目经理弄丢了东西却没有意识到,这种事比你想象的常见得多。在参与这个项目之前,我从没想过 AI 能处理这类工作。如果它能应付这些邮件、来回沟通和交叉核对,我相信它会成为会计部门真正的帮手。” 有 10 年建筑与项目管理经验的企业经营者 Austen K. 表示:“这些场景非常符合建筑业财务主管会遇到的情况。目前这些工作都由我自己处理。如果 AI 能接手,我就能腾出时间承接更多项目、拓展业务。对我这样规模的公司,这很容易带来每年六位数美元的价值。如果 AI 能学会这些并拿到高分,我很愿意让它到自己的公司试一试。”

这就是团队所说的“生态效度”(ecological validity)。它还关系到一种更易推广的部署方式:企业能否利用现有的软件、资料和带教流程,让 Agent 真正像新员工一样学会工作?

真实工作,

让模型真正拉开差距

单独测试软件操作时,两个模型的表现可能接近。但完成一份完整的工作,Agent 还需要从历史记录中学会公司的惯例,根据主管反馈和政策变化调整做法,并与供应商沟通、补充信息。这些挑战也会相互影响。软件操作不熟练,可能无法精确检索相关历史记录,公司的规则也就难以掌握。主管指出的问题未能改进,后续的账单则会继续出错。将这些挑战综合在一起,单项测试中不明显的差距就会累积。Fable 5.1 与 Opus 5 从其他榜单上的几分之差,到 ApprenticeBench 中的 72% 对 36%,这正是值得深入研究的差距。

AA:Fable 5.1 为 53,Opus 5 为 51。图源:Artificial Analysis 排行榜

Terminal-Bench 4.0:Fable 5.1 为 57.9%,Opus 5 为 51.8%。图源:Terminal-Bench 排行榜

CursorBench 4.0:Fable 5.1 Max 为 51.8%,Opus 5 Max 为 46.6%。图源:CursorBench 排行榜

此外,开源权重模型与闭源模型的差距也很直观。Fable 5.1 和 Kimi K3 在 AA 上分别是 53 和 44,而在这里则是 72% 和 18%。这 100 张账单中,一个模型有 28 张未通过,另一个则是 82 张。如果最终由你接手,这个差距恐怕难以忽视。这套评测提高了复杂案例的比例,不能直接等同于日常业务的错误率。不过,那些需要人类介入的地方,恰恰值得模型团队仔细审视。

下一版模型,

该往哪里使劲?

分数已经拉开,接下来让我们分析原因。ApprenticeBench 的几组分析,已经提供了一些具体线索。

用鼠标代替 API,模型要交多少“CUA 税”?

使用图形界面操作,究竟会对模型造成多大的拖累?为了公平比较,ApprenticeBench 团队专门基于 Odoo 的后台接口,定制了一套与图形界面功能对等的 API 工具,让模型分别通过两种方式完成同一份工作。

团队提出了“CUA 税”这一概念,用以衡量 agent 从 API 切换为 GUI 导致的成功率损失:

CUA 税 =(API 成功率 − GUI 成功率)÷ API 成功率

使用 GUI 带来的相对成功率损失随模型代际快速下降。图源:ApprenticeBench 博客

这笔“税”随模型迭代逐渐降低。Fable 5.1 的 GUI/API 成功率为 72%/70%,Astra 为 68%/65%。这一结果表明,当前最强模型的 CUA 税可能已经消失。

这意味着,Agent 有望直接使用企业现有软件,减少专门开发接口的需求。不过,GUI 的操作成本仍然更高,效率上还有提升空间。

模型原本就会,还是入职后学会的?

做对一道题,并不一定说明模型学到了新东西。它可能原本就会,也可能只是找到了可以照抄的答案。

团队设置了一个“聪明的新手”(smart novice)对照:仅保留公司手册和软件教程,移除历史账单、主管反馈和跨任务记忆,观察模型仅凭已有知识能完成多少。Fable 5 在此设置下仅通过了 11 张账单。单独加入历史账单,通过数上升到 31 张。单独加入主管反馈,则升至 35 张。两者同时提供时,达到了 43 张。公司里的经验,确实能帮助它把工作做得更好。

但找到旧答案,与学会处理新情况之间,仍有距离。在成本码实验中,当有先例可参考时,受测模型普遍表现良好。需要在历史账单中归纳规则时,Fable 5.1 和 Astra 才明显领先。

左侧是有先例可参考的成本码,右侧需要归纳隐含规则;虚线为 smart novice 参考表现。图源:ApprenticeBench 博客

有些模型在查看了历史账单、听取了主管反馈后,提升仍然有限。有些能从旧账单中找到答案,但需要自行归纳规则时,正确率就明显下降。这些对照让我们看清了分数背后模型能力的差距所在。

经验多了,为什么反而干得更慢?

人类熟悉工作后,通常会越做越快。在这次测试中,Agent 却普遍越做越慢。

人类与 Agent 的处理速度、笔记量随任务推进的变化。图源:ApprenticeBench 博客

笔记就是一个例子。Fable 5.1 写了约 19.2 万词,分散在 122 个文件中。人类测试者中,笔记较多的一位也只写了约 2,800 词。记得多并不代表用得好。笔记越积越多,查阅和维护它们也需要时间。还有一个有趣的例子:账单扫描件过于模糊,Agent 竟然自己编写图像处理程序,折腾了近两小时,最后还是找供应商要了份清晰的。本来发条消息就能解决,它却绕了一大圈。

这些问题,仅看成功率很难发现。将执行过程、消耗的时间和 token 一起分析,才能知道模型卡在了哪里。下一版模型应该学会什么、减少哪些无用功,也就有了具体的改进方向。

做得比人好,

还得算算账

Fable 5.1 的通过率达到 72%,超过了人类最高的 51%。但每张账单平均花费 18.23 美元,而人类是 7.21 美元,相差约 2.5 倍。这里,模型计算的是 token 费用,人工计算的是工作时间对应的工资。还有一些成本未计入。处理同样的 100 张账单,Fable 5.1 发出了 1,032 条消息,两位人类测试者分别是 508 条和 450 条。多出来的来回沟通,也需要同事花时间回应。

不过,成本不仅仅包括处理账单时的开销。让 Agent 进入一家企业,摸清业务、对接软件、配置流程,同样需要人力。这就回到了开头的 FDE 问题:这些部署和适配工作,有多少能交给 Agent 自己完成?

ApprenticeBench 的结果让人们看到了这种可能性。Agent 已经能够直接使用现有软件,也开始能从历史记录和主管反馈中学会公司的做法。如果这些能力足够可靠,那么更换客户时,就有机会让 Agent 自行学习,而不必事事依赖工程师定制。未来业务规则发生变化,它也需要能够持续学习、跟上节奏。

这条路要走通,Agent 还需做得更省、更稳,也更容易与人配合。但它的价值也很具体:减少人类花在翻查记录、核对表单、反复检查细节上的时间,让他们能多留些精力去理解客户、处理例外、做出判断。

NeoCognition 表示,他们期待人与 AI 一起工作,最终能比今天单靠人力提高十倍乃至百倍的生产力。这个目标能否实现,要看 AI 做对了多少,也要看部署、指导和复核它需要付出多少。最终,整个团队能多做多少事,才是这笔账的答案。

关于 NeoCognition

硅谷 Agent Lab NeoCognition 由苏煜、邓翔和谷雨联合创立,创始团队在 Agent 领域累计拥有超过 30 年的研究经验。他们相信,未来会有大量各有所长的专业 Agent,让更多人和组织用上过去难以获得的专业能力。公司已获得 Cambium Capital、Walden Catalyst Ventures、Vista Equity Partners,以及 Lip-Bu Tan、Ion Stoica、Dawn Song 等投资人与学者的支持。

Yu-Xiang Wang 近日宣布已从 UCSD 休假全职加入 NeoCognition。图源:X

最后还有一个彩蛋:王宇翔(Yu-Xiang Wang)教授近日宣布,已从 UCSD 休假,全职加入 NeoCognition 担任机器学习总监(Director of Machine Learning)。他从今年 7 月起就已与团队并肩工作,而这次发布的 ApprenticeBench,只是他们正在做的事情的一部分。

References:

[1] ApprenticeBench: The first end-to-end benchmark of computer use, continual learning, and long-horizon agentic capabilities, set in a real job. https://neocognition.io/blog/apprentice-bench/

[2] NeoCognition’s $40M seed funding. https://neocognition.io/press

[3] https://x.com/yuxiangw_cs/status/2098150506560659960?s=20

本文来自微信公众号“机器之心”,36氪经授权发布。

更多文章