
为了解决开发者的额度消耗焦虑,Anthropic官方近期发布了一份深度指南,拆解Claude Code 的计费底层逻辑,并整理出11 个最直接的省Token 实战技巧。
为什么相同的任务,花费可能差数倍?
Anthropic 指出,开发者支付的表面上是Token,本质上是GPU 的推论运算时间。成本主要由三大维度决定:
- 模型等级:大模型(如Opus)在输入与输出的单价均高于小模型(如Sonnet、Haiku)。
- 输入(Prefill)vs. 输出(Decode):解码阶段模型逐字产出(包含思考历程Thinking Tokens 与工具调用),GPU 占用时间长,因此输出Token 单价约为输入的5 倍。
- 提示词快取(Prompt Caching):这是节省成本的关键。命中的快取读取费用仅需0.1 倍(一折),但如果快取失效或被破坏,系统就必须以全价重新预填充(Prefill)整段上下文。
在多轮对话中,每一次送出的请求都包含了「系统提示词+ 专案设定+ 先前读取过的所有档案与指令输出」。这意味着,无关的历史纪录留得越久,后续每一轮对话的隐形成本就越高。
11 个Claude Code 实战省Token 技巧
1. 任务切换果断/clear
一个任务完成后立即执行/clear清空上下文。长对话越往后越昂贵,因为后续每一轮都会完整携带先前的对话纪录。如果是在同一个任务内但前段纪录已无用,再使用/compact压缩。
2. 开局定好模型与Effort 等级
中途切换/model、/effort或开启Fast mode 会改变快取的特征值(Cache Key),导致既有Prompt Cache 全部失效,下一轮将以全价重新计算上下文。建议在开局就设定妥当。
3. 暂离工作前先执行/compact
订阅用户的快取寿命约1 小时,API Key 预设约5 分钟。一旦快取过期,重新唤醒时需全额重算整段历史。趁着快取尚未过期时先进行/compact,生成摘要的成本会便宜许多。
4. 逻辑跑偏时用/rewind 代替/compact
若最近几轮互动偏离预期,使用/rewind即可精准删除后续轮次,前面的快取完全不受影响(零额外成本);相比之下,/compact会重写整段对话,反而会破坏快取。
5. 善用@档案名称载入上下文
在Prompt 中直接使用@档名,Claude Code 会在第一轮请求前将档案打包送出,省去模型额外发起一次Read工具调用与搜寻的成本。同一个档案在同个会话中标注一次即可,重复标注会塞入多份副本。
6. Prompt 尽量精确具体
避免模糊指令(例如「测试挂了」),应具体指定失败的测试与档案名称。模糊指令会迫使Agent 先执行grep、全域搜寻并读取大量无关档案,这些中间产物会永远滞留在上下文内。
7. 抑制测试与终端机的冗长输出
Build、Git Log 与测试输出的文字都会占用Context。建议在指令加上--quiet或用tail截断,或在CLAUDE.md中预先定义精简的测试指令(例如vitest --reporter=dot)。
8. 透过/context 检查启动负担
在新会话中执行/context,可检视CLAUDE.md、系统提示词及MCP 占用的初始Token 数。建议将专案特定流程拆至按需载入的Skills,并用/mcp关闭当前会话不需要的MCP 工具。
9. 杂活任务降级模型与思考强度
Thinking Tokens 同样属于昂贵的输出Token。对于常规、纯执行的工作,可选用较小模型或调低/effort;若要彻底关闭思考,可透过环境变数MAX_THINKING_TOKENS=0 claude启动。
10. 大量日志交给Subagent,轻量任务回归主会话
Subagent 拥有独立上下文,任务结束后只将最终摘要带回主会话,非常适合用来爬梳庞大日志或搜寻长篇文件(甚至可指派Haiku 执行)。但对简单任务而言,Subagent 重新载入设定的初始成本反而不划算。
11. /loop 循环指令务必另开独立会话
每次/loop都视为一次完整对话轮次,会持续携带当前会话的全部内容。若循环间隔超过1 小时还会引发快取失效。官方强烈建议另开一个干净的终端机视窗专门执行循环工作。
本文链接地址:https://www.wwsww.cn/rgzn/40645.html
郑重声明:本文版权归原作者所有,转载文章仅为传播更多信息之目的,如作者信息标记有误,请第一时间联系我们修改或删除,多谢。



