856 字
约 2 分钟
1
输入主导:62:1 的 I/O Ratio
无标签

Token 降本增效 · 7 / 13 输入主导:62:1 的 I/O Ratio 普通 Chatbot 是一问一答;Agent 是「思考 → 行动 → 观察 → 再思考」的循环。关键认知:每一轮的 Input 都包含了全部历史信息——轮次越多,Input 越长,成本累积膨胀。 ReAct 循环 输入主导 I/O Ratio 累积膨胀 一句话速览 Agent 每一轮都要重读全部历史。逐轮点开一个 Excel 任务,看 Input 怎么滚到 31,460 Token Chatbot vs Agent:计费结构完全不同 普通 Chatbot 问「讲个笑话」(10 Token),答 150 Token—— I/O Ratio ≈ 1:15,输出主导 。而 Agent 做一个代码修复任务:System Prompt、工具返回、历史输出,全都要在每一轮里重新读一遍。三轮下来,总 Input 16,790、总 Output 270—— I/O Ratio 62:1,输入主导 。

为了得到 270 个字的结果,你付了 16,790 个字的「阅读费」 。这就是 Agent 的输入主导特性。

Chatbot 单轮交互结束;Agent 的每一轮入口都带着全部历史,Input 累计膨胀。(图:作者分享原稿)

代码修复任务的三轮拆解:总 Input 16,790,总 Output 270,I/O Ratio 62:1。(图:作者分享原稿)

交互演示 · 一个「简单」任务的真实账单 任务:「帮我分析这个 Excel 表格,找出销售额最高的产品,然后生成一个图表。」点「下一轮」,看每一轮的累计 Input 怎么滚起来。

Excel 分析任务 · 5 轮执行 开始执行 ▶

五轮累计 Input 31,460、Output 450,合计约 0.014–0.026 元。注意:这只是一次成功的执行,隐形成本还有失败重试、调试、迭代。(图:作者分享原稿)

膨胀的数学:为什么是平方级 假设任务要 N 轮完成,System Prompt 长度 S,每轮新增(输出 + 工具返回)约 Δ。第 N 轮的 Input ≈ S + Q + Δ×(N-1),而 总 Input 是所有轮次的累加 ——里面藏着一个 1+2+3+…+(N-1) 的等差数列。每轮新增 500 Token 的话,5 轮循环的总 Input 就有 15,000+;轮次翻倍,成本接近翻两番。

Agent 框架(SWE-bench 实测) 平均 I/O Ratio 说明 简单 RAG Agent 10:1 ~ 20:1 检索 + 回答 OpenHands 20:1 ~ 50:1 代码修复任务 AutoGPT 类 30:1 ~ 100:1 开放式任务,循环多

这解释了为什么 KV Cache(第 11 节)对 Agent 是决定性的 :既然每轮都要重读同样的前缀,能不能命中缓存,就是 5 倍的价差。也解释了为什么要监控 I/O Ratio—— 比率超过 50:1,往往说明 Agent 在「空转」 ,该优化流程或降级任务了。

本节要点

✓ Agent 是输入主导的: 每轮 Input 都带全部历史,总量按轮次的平方级膨胀。 ✓ 单次执行看着便宜,规模化才见真章: 0.02 元的任务 × 失败重试 × 百万调用,就是账单窒息现场。 ✓ 把 I/O Ratio 当健康指标监控: >50:1 说明 Agent 在空转,先查流程再谈省钱。

内容来源: 整理自作者团队内部分享《AI Token 降本增效策略分享》「Agentic 应用的计费机制」。行业数据参考 SWE-bench 上的 Agent Token 消耗实证研究(见收官节阅读材料)。Agent 循环的原理详见 动手实战篇 。

输入主导:62:1 的 I/O Ratio
http://www.clxhxhhr.top/posts/3983/
作者
clxstart
发布于
2026-09-25
许可协议
CC BY-NC-SA 4.0
评论
0 条
还没有评论,先写一条吧。