资讯 · 改写稿

压缩工具输出能省 API 账单吗:实测只省约 2%

来源页是一次带实测的工程记录:作者把「压缩工具输出」做成插件,中间弄坏过一次,重写后做了对照测量。结论写在最前面——在 DeepSeek V4 Pro 上,每会话省约 2%,小于普通的运行间波动,原因是提示缓存已经把重复输出变得几乎免费。

为什么看起来该省钱

写码 Agent 的模型不能自己读文件或跑命令,它发起工具调用,Agent 在本地执行,输出追加进对话。之后每一轮,Agent 都会把整段可见对话再发回模型,包括之前所有的工具结果。于是这段日志被反复当作输入计费,上下文也越来越满。压缩它,直觉上就是把重复的输入变小。

来源页也点出适用边界:这套做法针对「会重发可见历史」的框架,通常是 Chat Completions 或 Messages 风格的接口;如果服务方自己持有历史(例如用 previous_response_id 的 Responses 接口),插件就无法改写早先的条目,那是另一套机制。

为什么实际只省约 2%

因为提示缓存。重复的旧输出在缓存命中后几乎不产生费用,压缩能省下的那部分本来就已经很小。作者把这一点作为结论:想省账单,先确认缓存是否命中,再谈压缩。

还有一个值得记住的细节:作者第一次实现时出了问题,重写后才拿到可信数字。这提醒一件事——测量本身要先立住。如果把「运行间波动」当成基准,任何小于波动的优化都测不出来;判断这类优化值不值,得先看波动范围,再看收益是否稳定地大于波动。

本站计算

把 2% 折成具体量级:本站计算——用站内 额度计算器(默认 1 个 Token 约合 1.5 汉字)换算,若一次会话消耗 100 万 Tokens,省 2% 就是 2 万 Tokens,约合 3 万汉字;若会话消耗 1000 万 Tokens,省下约 20 万 Tokens,约合 30 万汉字。量级不算小,但相对总账单仍是零头。要压成本,优先做站内 省写码额度的 5 个办法里那些更有效的事。

容易踩的坑

把压缩当成省钱主力:实测每会话约 2%,小于正常波动。

忽略提示缓存:重复输出命中缓存后本就近乎免费。

在不支持改写历史的接口上做压缩:服务方持有历史时改不动早先条目。

自检清单

压缩历史工具输出看着是笔明显的省钱,实测却不是:在一套真实配置上,每会话只省约 2%,比正常的运行间波动还小。

常见问题

压缩工具输出能省多少?

来源页实测:在 DeepSeek V4 Pro 上每会话约省 2%,小于普通的运行间波动。

为什么省得这么少?

因为提示缓存已经让重复的工具输出几乎免费,压缩能省的部分本就不多。

什么情况下这个方法不适用?

当服务方自己持有对话历史时(例如用 previous_response_id 的接口),插件无法改写早先条目。

那要怎么才能明显省钱?

优先换便宜模型跑简单任务、减少多余产出、让工具做确定性的格式化与 lint,这些比压缩历史更有效。

来源参考

以上为外部来源;本文为 RefHub 用自己的结构重写,事实以来源页为准,价格与政策会变,请回源核对当日。

下一步:想看更有效的省钱办法,读 5 个省写码额度的办法;要估算会话消耗,用 额度计算器。