首页 > 宇宙

模型一模一样,Token 却相差 70 倍?三项实测揭开 AI 编程工具的成本黑洞

时间:2026-09-09来源:网络作者:小白

作者 |Janakiram MSV

译者 | 田橙

策划 |Tina

当团队评估 AI 编码智能体的成本时,往往会仔细审视模型。

但最近的三项基准测试表明,智能体框架,也就是引导模型完成任务的软件,可能同样重要。

任何 Web 开发者都会熟悉其中的原因:每次推理请求都需要上下文。

相关历史记录要么必须再次提供,要么需要由服务系统重新构建。

因此,提供商在每一轮中都要处理大量相互重叠的文本,其中包括智能体框架的系统提示词和工具说明。

今年 6 月,一项独立的 基准测试 使用两个模型,在相同的 12 个 Python 任务上比较了 12 种配置。

8 月,Composio 比较了 八种智能体框架,使用 DeepSeek V4 Flash 完成 30 个企业工作流。

与此同时,Artificial Analysis 通过其 编码智能体指数 持续追踪智能体框架与模型的组合。

三项基准测试测量了什么

Composio 公布了 30 个工作流,涵盖 Airtable、Gmail、Google Calendar、Google Sheets、GitHub、Slack 和 PostHog。

每项任务的运行时间上限为 900 秒。

结果由程序化验证器而非大语言模型裁判评分,测试使用隔离的固定数据,其中预置了干扰项和近乎相同的键。

Composio 报告了 240 次任务执行结果,其中 129 次成功完成了工作流。

每次成功完成任务的成本从 Pi Agent 的 0.028 美元到 Claude Code 的 0.195 美元不等。

DeepAgents 的通过率与 Claude Code 完全相同,但每次成功执行的成本仅为后者的四分之一。

这项对照实验并不完美,Composio 也对此进行了透明披露。

Pi 通过两个模型提供商运行时使用了不同的推理设置,而 Prime Agent 的 30 次运行中只有 24 次可以评分。

这些限制意味着,不能把它称为一次严格控制单一变量的实验。

6 月的基准测试衡量的是 Token,而不是美元,测试范围也更广。

作者报告了 Aider、Claude Code、Codex、Goose、Hermes、Kilo、Kimi Code、Nanobot、OpenClaw、Opencode 和 Qwen Code 的运行结果,并将 Aider 的 architect 模式作为一种单独的配置计算。

所有 12 种配置都通过 OpenRouter 运行相同的任务,因此每种智能体框架都使用了相同的 API 和模型。

测试套件先在 DeepSeek V4 Flash 上运行,随后又在英伟达的 Nemotron 3 Ultra 上运行。

第二个模型在 OpenRouter 上提供免费额度,因此你可以免费重新运行这项测试。

文章报告称,每解决一项任务所消耗的 Token,从使用 architect 模式的 Aider 约 3500 个,到 OpenClaw 的 29.2 万个不等。

这个范围之所以具有参考价值,是因为它非常稳定:在两个毫不相关的模型之间,排名几乎没有变化。

这说明差异来自智能体框架软件,而不是模型行为。

Artificial Analysis 使用更大的统计样本研究了同一个问题。

Artificial Analysis 发布了一项综合指数,涵盖 DeepSWE、Laude Institute 的 Terminal-Bench v2.1,以及 Scale AI 的 SWE-Atlas-QnA。

总计包含 326 项任务,每项任务运行三次后取平均通过率。

它会报告每种组合的单任务成本、Token 用量和耗时。

此外,它还发布了一项对照比较,在固定使用 Claude Opus 4.7 的情况下,分别搭配 Claude Code、Cursor CLI 和 Opencode。

启动税

归根结底,这种差距源自 6 月基准测试中的一项指标:启动税。

在提示词开始处理任何任务之前,智能体框架就会先发送自己携带的负担。

这些负担包括系统提示词、工具说明和环境设置。

基准测试报告称,使用 architect 模式的 Aider 约为 700 个 Token,而 OpenClaw 约为 2.6 万个。

如果这种 40 倍的开销只需支付一次,尚且可以接受,但重复发送的模式改变了这一点。

作者指出,一个每轮至少携带 2.6 万个 Token、持续运行 15 轮的智能体框架,仅脚手架就会消耗约 39 万个输入 Token。

这个计算经测试也站得住脚。

启动税乘以轮数,能够预测每项已解决任务的 Token 用量,在两个模型上的决定系数 R² 均为 0.99。

希望降低智能体支出的开发者,应该先关注提示词的最低开销和轮数,再考虑更复杂的优化。

这张回归图需要附带一项说明。

6 月的基准测试中,每种智能体框架、任务和模型组合只运行了一次,因此没有方差估计,而智能体的运行具有随机性。

在这方面,Artificial Analysis 的结果更有分量,因为它针对 326 项任务各运行三次并取平均值。

可以把 6 月测试发现的开销视为对其作用机制的证据,而在比较当前生产规模的组合时,规模更大的指数是更可靠的衡量工具。

昂贵的智能体框架并不是在囤积上下文,只是承担了更高的基础开销。

令人意外的是,有些因素并不能解释这种差距。

所有智能体框架的上下文都以相近的速度增长,每轮增加几百个 Token,因此增长速度并不是造成差异的原因。

昂贵的智能体框架并不是在囤积上下文,只是承担了更高的基础开销。

缓存 Token 改写了排行榜

两项智能体框架实验得出了第二个共同机制,而 Artificial Analysis 也在其方法中把它视为一项实质性因素。

它也是平台团队最容易判断错误的因素。

Composio 披露,Claude Code 的输入 Token 中只有 1.5% 来自缓存,而 Codex 约为 70%,OMP 约为 57%。

新输入的成本大约是缓存输入的五倍。

因此,Claude Code 的 Token 消耗量与竞争对手相当,账单却并非如此。

6 月的基准测试在自己的测试环境中发现了类似的不对称现象。

在 DeepSeek 的运行中,Codex 为整个测试套件计费的 Token 超过 100 万个。

其中 77% 是缓存读取,收费约为正常价格的十分之一。

按照实际账单的计价方式计算,Codex 每解决一项任务的成本低于 Claude Code,尽管后者使用的原始 Token 只有它的一半。

作者认为,Claude Code 几乎为零的缓存占比源于服务路径,而不是它的提示词。

在该测试环境中,Claude Code 是唯一通过 Anthropic 风格的 messages 端点与 OpenRouter 通信的智能体框架。

网关对这种协议格式的转换,似乎降低了缓存命中率,而相同流量通过 OpenAI 风格的端点原本可以获得更高的缓存命中率。

网关行为会发生变化,因此应把它视为某条实际观测到的路径。

Artificial Analysis 并不是在测试中发现这一点,而是直接将这一假设纳入了成本模型。

它提醒用户,提示词缓存命中率会随着提供商的路由方式产生很大差异。

它的成本模型会分别计算缓存输入和缓存写入的价格,而不是把所有提示词 Token 都按未缓存费率计费。

一项基准测试如果必须单独核算缓存写入成本,本身就说明服务路径对成本的影响不容忽视。

重型智能体框架的成本花在了哪里

解释成本差距,并不等于认定最便宜的智能体框架就是最佳选择。

查看、操作、检查、重复这一智能体循环会放大成本。

它最适合处理不熟悉的代码、失败的测试,以及横跨多个文件的修改。

对于规模较小、描述清楚的编辑任务,这个循环大多只是在反复确认一次调用原本就可以直接假定的内容。

但高难度任务测试的结果并没有像脚手架开销论点所预测的那样发展。

四种成本跨度很大的智能体框架在宽松的限制下运行了十项 SWE-bench Lite 任务,四者最终都只解决了同一项任务。

作者报告称,Aider 消耗了 80 万个 Token,而 Codex 消耗了 1500 万个 Token。

只在一个模型上运行十项任务,显然不足以支持广泛概括,因此应把这一结果视为一种提示。

在质量方面,“智能体框架决定价格”这一说法需要加以限定,因为这些基准测试并不支持把两者等同起来。

Composio 报告了八种智能体框架的通过率,从 OpenCode 的 46.7% 到 Pi Agent 的 66.7%,在同一个模型上相差 20 个百分点。

Artificial Analysis 在规模更大的任务集中也公布了同类差距。

智能体框架的选择会让成本相差数倍,也会让任务成功率相差若干个百分点,两者的差别在于影响幅度,而不是影响方向。

平台团队应该衡量什么?

企业已经开始发现,拥有自己的智能体框架并不能彻底解决成本问题。

即使团队 构建了 自己的编码智能体,仍然需要为底层推理付费。

成本控制已经从模型合同转移到了平台层。

问题 应衡量什么 为什么显而易见的指标会产生误导

哪种智能体框架更便宜

每个经验证结果的成本

Token 数量忽略了通过率和缓存层级

我们支付的是标价吗

实际流量中的缓存占比

折扣取决于网关和端点,而不只取决于智能体框架

它能处理大型提示词吗

实际传输的字节数与应发送的字节数

静默截断在输出中看起来像是成功

每项成功任务的成本,而不是每项任务的成本

如果分别查看通过率和 Token 数量,就会对智能体框架做出错误排名。

Claude Code 和 DeepAgents 完成了相同数量的 Composio 工作流,但 Claude Code 每次成功运行的成本高出四倍以上。

采购团队应该要求查看每个经验证结果的成本,并拒绝仅按 Token 进行比较。

实际服务路径上的缓存占比

缓存折扣并不只是智能体框架本身的属性。

它取决于端点协议、网关和提供商。

平台团队可以在一个下午内验证自己实际流量中的缓存比例,而这项工作比迁移模型更有价值。

负载下的提示词保真度

6 月的基准测试在每项任务前注入了 10 万个 Token 的无关日志噪声,并报告了五种不同的行为。

在 12 种配置中,有七种完整传输了提示词。

Kilo 和 Opencode 丢弃了其中 83% 至 89% 的内容,却仍然报告成功。

静默截断的危险之处在于,从智能体框架的输出来看,它与成功执行毫无区别。

OpenClaw 拒绝运行,Kimi Code 崩溃,Claude Code 则发送了全部内容,但随后表现不佳。

静默截断非常危险,因为在智能体框架的输出中,它看起来与成功完全相同。

接下来会怎样

Anthropic、OpenAI、Google 和 Microsoft 在智能体框架层的 收费模式 上已经走向不同方向。

随后,DeepSeek 又以 MIT 许可证开放了自己的运行时,并允许替换其中的每个组件。

如今,开发者可以通过一项公开且持续更新的指数,比较不同的智能体框架与模型组合。

这恰恰也是模型定价开始受到挑战的前提。

对于计划在本季度统一智能体平台的企业而言,智能体框架值得接受与模型同等严格的审视。

这些实验表明,在模型基本不变的情况下,仅仅更换智能体框架,就能造成足以媲美模型定价差异的成本差距。

开发者、平台团队和财务负责人如今终于有了可重复验证的依据,可以围绕这个问题展开讨论。

而在三个月前,关于智能体框架的讨论还拿不出这样的依据。

声明:本文内容仅代表作者个人观点,与本站立场无关。

如有内容侵犯您的合法权益,请及时与我们联系,我们将第一时间安排处理。