789 字
约 2 分钟
1
报价表速览与三大梯队
无标签

Token 降本增效 · 3 / 13 报价表速览与三大梯队 把常用模型的定价摊开在一张表上,你会看到三个清晰的梯队。但仅仅知道哪个贵、哪个便宜是远远不够的——真正的成本刺客,藏在那些价格跳变的边界线里。 T0 旗舰 T1 主力 T2 走量 缓存价 一句话速览 T0 旗舰 / T1 主力 / T2 走量怎么分工;光知道哪个贵不够,要盯住价格跳变的边界线 报价表全景 下面是作者团队当时主要使用的模型定价( 已折算折扣后 ,单位:元 / 百万 Token)。三列分别是非缓存输入、缓存输入、输出——注意缓存价普遍只有标准价的两成甚至更低,这个巨大的差价就是第 11 节 KV Cache 的伏笔。

模型 档位 输入(非缓存) 输入(缓存) 输出 GLM-4.6 (355B A32) Input ≤32k · Output ≤200 1 0.2 4 Input ≤32k · Output >200 1.5 0.3 7 Input 32k–200k 2 0.4 8 Qwen3-Max Input 0–32k 1.6 0.32 6.4 Input 32k–128k 3.2 0.64 12.8 Input 128k–252k 4.8 0.96 19.2 Qwen-Plus (235B A30) 0–128k · 非思考 0.4 0.08 1 0–128k · 思考模式 0.4 0.08 4 Qwen-Flash Input 0–128k 0.075 0.015 0.75 Input 128k–256k 0.3 0.06 3 GLM-4.5V / 4.5-Air Input 0–32k 1 0 3 Input 32k–64k 2 0 6

红色数字是「跳档后」的价格。同一个模型内部,价格能差 2–3 倍——这些边界线是第 4、5、6 节的主角。

三大梯队

T0 · 旗舰 Qwen3-Max、GLM-4.6(长输出档) 输出昂贵,能力天花板。 留给复杂推理、代码生成、多模型仲裁这类「答错了损失更大」的任务。

T1 · 主力 Qwen-Plus、GLM-4.5-Air 性价比均衡。 日常对话、RAG 问答、摘要归纳的主力,大部分请求应该落在这一层。

T2 · 走量 Qwen-Flash 近乎免费 (缓存输入 0.015 元/M)。数据清洗、意图分类、高频监控随便跑,也是给大模型「打下手」的最佳人选。

懂技术的人看模型参数,懂经营的人看定价阶梯。 做 AI 工程,两个都要懂。

交互演练 · 这个任务该用哪个梯队 五个真实业务场景,选一个你认为最合适的梯队。原则: 能用便宜的绝不用贵的,但答错代价大的别省。

下一题

本节要点

✓ 先分梯队再选型: T0 管难题、T1 管日常、T2 管走量。大部分成本事故是「用 T0 干 T2 的活」。 ✓ 缓存价是标准价的 1/5 甚至更低。 能不能吃到这个折扣,取决于你的架构设计(见第 11 节)。 ✓ 同一模型内部价格能差 2–3 倍。 跳档边界线(输出 200、输入 32k)比模型选型本身更值得盯。

内容来源: 整理自作者团队内部分享《AI Token 降本增效策略分享》。表中为作者当时的折后协议价,各家牌价与折扣随时在变,选型前请核对 DeepSeek 定价 、阿里云百炼与智谱开放平台的实时报价。

报价表速览与三大梯队
http://www.clxhxhhr.top/posts/3979/
作者
clxstart
发布于
2026-09-25
许可协议
CC BY-NC-SA 4.0
评论
0 条
还没有评论,先写一条吧。