资讯 · 改写稿

只做判断的小模型:Strands Decider 2B 与「决策模型」这一类

结论先给:决策模型放弃了「生成」,换来的是同尺寸下更强、延迟更低、且每次判断都带一个可靠性分数。Strands Decider 2B 把这条路走成了 2B 参数、可在本地 CPU 运行的开源模型。

来源(Strands Agents 博客)发布了 Strands Decider 2B:一个面向快速实验、本地开发与创新的小型开源决策模型。来源把它归入「决策模型 / System One 模型」这一类,并明确说这一类在 TypeSafe AI 本月发布 Jev 之后获得了大量关注。

它和普通大模型差在哪

来源把差别讲得很清楚:大模型可以生成任意输出,而决策模型只做两件事——在一组选项里挑一个(比如「『turn on the lights』这句是在说咖啡机吗?是或否」),或者给一个简单的数值分数(比如「这句话是正面情绪吗?0 到 1 之间」)。

用灵活性换来的好处是:更快、同尺寸下更强、总能在给定选项里给出答案、延迟可以很低。反过来,代价也很直接:

两个容易被忽略的性质

来源强调了决策模型的两个额外特点:每个判断都会附带一个高质量的可靠性分数(「这个『是』我有多确信」),而这在前沿大模型的推理 API 里是拿不到的;此外,针对同一段提示词同时问多个问题,它的效率非常高。来源认为这两点正好契合很多开发者用 Strands 那套工具在搭的 Agent 工作流。

它有多大、怎么做的

来源称 Decider 2B 是 20 亿参数的模型,适合跑在本地 CPU 或 GPU 上,能在几十毫秒内返回答案,准确度与校准度在这一类模型里与已知同类相当。架构上的核心思路是:拿一个预训练好的大模型「躯干」(Qwen3.5-2B),去掉语言模型头(也就是拿走它生成文本的能力),换成一个指针头来给候选答案打分。

本站计算——按 4-bit 量化估算参数占用:20 亿 × 4 ÷ 8 = 10 亿字节,约 1 GB。这解释了它为什么能跑在本地 CPU 上;对照前沿大模型 3 秒到 300 多秒的延迟,决策模型把「一次判断」的成本压到了毫秒级。来源还把它开源了:代码在 GitHub、权重在 Hugging Face,连训练数据和脚本一并放出。

容易踩的坑

拿决策模型做编码或摘要:它不生成文本,这类任务本就不适合。

指望它解决复杂推理:单次并行输出让它明显弱于推理模型。

忽略可靠性分数:这是它相对前沿推理 API 的独有信息。

自检清单

常见问题

什么是决策模型?

来源称这类模型不做任意生成,而是从给定选项中挑一个,或输出一个简单数值分数,用灵活性换取速度与同尺寸下的能力。

Decider 2B 有多大?

来源称它是 20 亿参数的模型,适合在本地 CPU 或 GPU 运行,能在几十毫秒内返回答案。

它的架构有什么特别?

来源称做法是取预训练的 Qwen3.5-2B 躯干、去掉语言模型头,换成一个给候选答案打分的指针头。

它适合和不适合什么?

适合驱动需要大量判断的 Agent 工作流;来源明确说不适合编码、聊天机器人、文档摘要等需要生成文本的任务。

来源参考

以上为外部来源;本文为 RefHub 用自己的结构重写,事实以来源页为准,价格与政策会变,请回源核对当日。

下一步:会做判断的模型怎么用,读 Jev 与类型化判断;判断该不该回话,见 Agent 接进群之后。