教程 · 分步实操
怎么把 LLM API 成本砍下来:5 步实操(2026)
先把结论放前面:LLM 账单的大头往往不在单价,而在「每轮把多少上下文重复发上去」和「用最贵的模型干最便宜的活」。下面 5 步按「先量、再改」的顺序来,做完再用同一批任务复测。
很多人优化成本时先换便宜模型,结果质量掉了、返工变多,总账反而更高。更稳的顺序是先把用量看清楚,再动结构。
分步做法
先量出每轮实际发了多少 token
在客户端日志或网关统计里记录中位数值,区分「输入 token」与「输出 token」。多数人第一次看到输入占九成以上,这就是要动的地方。
按任务难度做模型分级路由
把任务分成规划/难题与执行/常规两类:难题交给前沿模型,常规执行交给便宜模型。站内实测口径见「顶级模型开局、便宜模型干活」的折算,单 token 成本比可达数十倍。
压缩工具输出与历史
工具返回的长日志、网页正文只保留结论再塞回上下文;历史轮次做摘要。别把整段原文反复回传。
打开提示缓存(prompt caching)
把稳定的系统提示与固定前缀放在最前,命中缓存的部分通常按更低价格计费。具体折扣以各家官方定价页为准。
加一个预算熔断
给单任务设 token 或金额上限,超阈值就停并提示,避免一个死循环把预算烧光。
一上来就换便宜模型:质量掉了返工更多,总账可能更贵。
只优化单价不看用量:输入 token 才是多数账单的大头。
缓存前缀不稳定:系统提示里混入时间戳/随机 id 会让缓存永远不命中。
没有熔断:一个失控循环就能把当日预算烧完。
自检清单
常见问题
先换便宜模型不是更省吗?
未必。便宜模型在难题上返工更多,总 token 可能更高。更稳的是分级路由:难题用前沿模型,常规执行用便宜模型。
提示缓存一定能省钱吗?
命中缓存的部分通常按更低价格计费,但前提是前缀稳定。系统提示里混入时间戳或随机 id 会让它一直不命中,具体折扣以官方定价页为准。
压缩上下文会不会丢信息?
压缩的是「回传给模型的原文」,不是你的数据本身。工具输出与历史轮次保留结论即可,需要时再按需重新取。
怎么知道优化有没有效果?
用同一批任务在优化前后各跑一次,比较总 token 与总金额,而不是只看单次单价。
来源参考
以上为官方文档/定价页;操作步骤与数值口径为 2026-10-08 核对所得,产品会变,请回源核对当日。
下一步:想先理解为什么要分级路由,读 顶级模型开局、便宜模型干活;想估算额度消耗,用 额度计算器。