Token 降本增效 · 4 / 13 GLM 的短输出博弈:200 Token 断崖 观察 GLM-4.6 的定价结构,会发现一个神奇的设计:它不按输入长度分档,而是按输出长度分档,分界线在 200 个 Token。输出 199 和输出 201,适用完全不同的价格。 输出分档 回溯计价 任务拆分 边界波动 一句话速览 输出 199 和 201 是两种价格,连输入都回溯涨价;拖动滑块看账单跳变,四种应对策略 现象:不仅输出涨价,输入也回溯涨价
指标 Output ≤ 200 Output > 200 变化幅度 输出单价 4 元/M 7 元/M +75% 输入单价 1 元/M 1.5 元/M +50%
最容易被忽略的一点: 只要输出超过 200 Token,前面传入的几千个 Token 的输入也要按更高的价格重新结算 。输出多写两个字,整单回溯涨价。
智谱为什么这么定价 这反映了推理算力的边际成本曲线。短输出(<200 Token)非常轻量:Decode 阶段压力小、KV Cache 占用有限,可能几十毫秒就完成了。但输出一旦变长, 每多生成一个 Token,KV Cache 就多占一份显存,Attention 就多算一轮 ——成本非线性增长。
厂商通过价格杠杆传递信号: 鼓励短平快的任务,惩罚冗长的生成。
交互演示 · 在断崖边反复横跳的账单 场景:从用户评论中提取结构化 JSON(sentiment / aspects / pain_points / suggestions)。Prompt 已经很规范,但 你无法预知每条评论会提取出多少内容 ——简单评论 150 Token,用户多吐槽两个点就变 230。拖动滑块感受这个「结构性冲突」。
本次输出长度
150 Tokens
100 ← 200 断崖 → 320
输入单价(3k 上下文) 1 元/M 输出单价 4 元/M 单次调用成本
业务输出天然在 150–230 之间波动,而断崖恰好画在 200:这是业务波动性与定价断崖的结构性冲突。(图:作者分享原稿)
四种应对策略
策略 做法 代价 任务拆分 把提取任务拆成多次调用,每次只提取 1–2 个字段 调用次数增加,延迟上升 字段分级 核心字段实时提取,次要字段异步补充或后处理 架构复杂度增加 接受波动 + 监控 允许偶发跳档,但建立监控看整体分布 成本可控但非最优 模型降级 价格敏感的高频任务切到 Qwen-Flash 等走量模型 可能牺牲少量精度
核心判断点是: 这个任务的输出,天然落在哪个区间? 如果大部分请求在 100–150、偶发超 200,可以接受。如果分布中位数就在 180–220,说明任务天然踩在断崖上——必须重新设计任务粒度,或者干脆换一个不按输出分档的模型。类似的情况也出现在代码生成场景:一个 20 行的函数就能轻松占用 100+ Token,稍复杂的修改建议就会突破 200。
本节要点
✓ GLM-4.6 按输出长度分档,200 是断崖: 输出 +75%,输入回溯 +50%。 ✓ 定价结构反映算力成本: 长输出的 KV Cache 与 Attention 开销非线性增长,厂商在用价格赶你走短平快路线。 ✓ 先看任务的输出分布,再选策略。 中位数踩在断崖上的任务,要么重切粒度,要么换计费模式不同的模型。
内容来源: 整理自作者团队内部分享《AI Token 降本增效策略分享》「GLM-4.6 的短输出博弈」。价格为作者当时折后价,请以智谱开放平台实时报价为准。