Token 降本增效 · 12 / 13 输出层:管住模型的嘴 实战四层的最后一层。输出 Token 比输入贵好几倍(回看第 3 节报价表),而且直接决定接口返回速度。管住模型的嘴,有三类合适的操作:指令层、代码层、工程层。 负向约束 Diff 输出 停止序列 一句话速览 明确的负向约束砍掉 30% 废话;润色用 Diff 别重写整段;停止序列做物理截断 指令层 · 写明确的负向约束 很多人知道要求「请简洁回答」,但这是有问题的—— 「简洁」对模型来说太抽象了,它不知道你要多简洁 。有效的写法是把「别干什么」列清楚:
✗ 模糊约束 请简洁回答。
→「当然,这是您要的代码。它实现了 一个简单的功能……希望对您有帮助。」
✓ 明确的负向约束 不要寒暄、不要总结、不要客套, 直接输出结果。 (英文:No yapping. No preamble, no postscript.)
→ def function(): return True
实测下来, Agentic 场景能砍掉 30% 的废话 。说白了就是告诉它:别整那些有的没的,直接上结果。
「Be concise」是玄学,「No preamble, no postscript」是指令:代码生成任务平均减少 30% 废话消耗。(图:作者分享原稿)
代码层 · 润色用 Diff,别重写整段 这是文字润色场景最大的成本坑:用户说「把这句话改通顺一点」,模型把 2,000 字的文章从头输出一遍。就算约束到只输出那个段落,Token 也在哗哗地烧。 换个思路: 让模型只输出修改的部分 ——用 Diff 格式标出「原文→改后」,或者直接返回正则表达式,程序拿到后再做替换。只动那两三个词,1 秒搞定: 成本差几十倍,体验还更好 ——速度快,用户还能直接看到改了哪里,不用自己对比。
- 我们的产品在市场上是很有竞争力的存在
- 我们的产品很有市场竞争力
或返回替换指令:{"find": "在市场上是很有竞争力的存在", "replace": "很有市场竞争力"}
工程层 · 停止序列做物理截断 在 Prompt 里写「请只输出 3 项」,模型听不听是玄学——可能输出 3 项,也可能 5 项再加一段总结。但 停止序列(stop sequence)是物理截断,和模型「听不听话」无关 :API 检测到指定字符串就直接掐断生成流,被掐掉的部分不计费、不进历史上下文。
简单,粗暴,但好用。 有效控制输出,就是控制成本和用户体验。
本节要点
✓ 负向约束要具体: 「不要寒暄、不要总结、不要客套」比「请简洁」有效得多,Agentic 场景砍 30% 废话。 ✓ 润色输出 Diff 或替换指令, 别让模型重写整段:成本差几十倍,用户体验反而更好。 ✓ 停止序列是物理开关: 列表掐「4.」、单行答案掐换行、JSON 掐「}」、防自问自答掐「用户:」。
内容来源: 整理自作者团队内部分享《AI Token 降本增效策略分享》实战篇「04|输出」。停止序列参数见各家 API 文档(OpenAI 兼容接口为 stop 字段,最多可设 4 个序列)。