资讯 · 改写稿
写代码时怎么省 AI 额度:5 个能立刻用上的办法
整天开着写码 Agent,额度烧起来很快。来源页用一套具体倍数说明:省钱不是少用,而是把贵的地方用对。
1 简单任务换便宜模型
修个小 bug、改个属性名,不需要最新的前沿模型。来源页给出了一套倍数(以 Auto 为 1.0x 基准):Qwen3 Coder Next 约 0.05x、MiniMax M2.1 约 0.15x、DeepSeek 3.2 约 0.25x,而前沿模型 Opus 5.5 约 2.0x。折算下来,一个在 Auto 上花 10 个额度的任务,在 Opus 5.5 上要 20 个,在便宜的开源权重模型上只要 0.5 个——**同一任务最高约 40 倍价差**。倍数会随新模型变化,定档前先看当天的模型页。
2 把 token 规则写进 steering 文件
steering 文件是会被当作常驻上下文加载的 Markdown。把「不要创建多余文件」「没让我写就别写测试」「尽量省 token」这类规则写进去,就不必每次重复。放常驻用 inclusion: always;只在与某些文件打交道时生效用 inclusion: fileMatch。注意常驻文件也会随每次请求一起发送,所以要短。
3 规格驱动开发,用两个模型分工
要动脑的是需求与设计阶段,把强模型留给它;需求与设计文档定稿后,实现阶段用便宜模型照样能按清单干活。切换在动手前改模型选择即可,先跑第一个任务验收,再放开跑其余的。
4 让 ESLint、Prettier 和 hook 做确定性的事
格式化与 lint 修复有唯一答案,交给工具而不是大模型。让 Prettier 与 eslint --fix 在保存或提交时自动跑,就不必花钱让 Agent 读文件、推理、再写一份工具瞬间能出的 diff。用 package.json 脚本加 lint-staged、Husky 钩子即可;钩子里用命令动作不消耗额度,用 Agent 提示动作才会。
5 盯住上下文窗口
每一轮对话都会把历史重新发一遍,会话越长,每条消息携带的上下文越多。接进来的 MCP 服务器也占上下文:来源页给的数据是,五个 MCP 服务器可能带来 100 多个工具定义、50000 多 Tokens,在第一次提问前就吃掉约 40% 的上下文窗口。做法是:关掉当前项目用不到的 MCP,换任务就开新会话,别让上一个任务的历史一路带着走。
一直用同一个前沿模型:简单任务也在按最贵的倍数付费。
steering 文件写得太长:它随每次请求发送,越长越贵。
让 Agent 去跑格式化与 lint:这类活有确定答案,交给工具更省。
MCP 服务器开一堆不管:工具定义会占掉大块上下文。
自检清单
省额度的第一刀,是别拿最贵的模型干最简单的活。同一个任务换模型,消耗最高能差约 40 倍。
常见问题
同一个任务在不同模型上能差多少?
来源页的例子里,Auto 上 10 个额度的任务,在 Opus 5.5 上 20 个、在便宜的开源权重模型上 0.5 个,最高约 40 倍。
steering 文件是什么?
会被当作常驻上下文加载的 Markdown。放「不要创建多余文件」这类规则,就不必每次重复;文件越短越省。
为什么格式化不该交给 Agent?
格式化和 lint 有确定答案,Prettier 与 eslint --fix 每次输出相同。让 Agent 做等于花钱重做工具瞬间能完成的事。
MCP 会占多少上下文?
来源页给的数据是,五个 MCP 服务器可能带来 100 多个工具定义、50000 多 Tokens,约占上下文窗口的 40%。
来源参考
以上为外部来源;本文为 RefHub 用自己的结构重写,事实以来源页为准,价格与政策会变,请回源核对当日。