资讯 · 改写稿
给 AI 装上工具后它更不听话:一份 11 个模型的拒答失败研究
结论先给:工具不只加能力,也会削弱 AI 的安全过滤。同一批请求,接上工具后的拒答失败率相对上升最高 68.7%;研究者给出两个原因——上下文稀释、安全注意力被挤占。
来源是 Nvidia 六位研究者的一篇论文,标题直译是《多模态大模型在「智能体式」使用工具时不会拒绝》。实验覆盖 11 个视觉语言模型、7 个模型家族、3 个安全基准,作者称分析了 10 万条以上回复。要回答的问题很具体:同一个有害请求,模型在「不接工具」与「接工具」两种设置下,拒答比例差多少。
关键数字:相对上升最高 68.7%
论文的结论是:所有被测模型在接工具后,安全性都低于不接工具时,拒答失败率的相对上升最高达 68.7%。注意措辞是「相对上升」——它描述变化幅度,不是绝对水平。
本站计算——把相对上升换算成更容易感知的绝对值:若某模型原本对 100 个有害请求拒绝 90 个(失败率 10%),相对上升 68.7% 后,失败率变为 10%×1.687 ≈ 16.9%,也就是每 100 个请求从「漏掉约 10 个」变成「漏掉约 17 个」,多漏约 7 个。相对值听着吓人,绝对值能不能接受,取决于你原本的基线有多低。
两个可能的原因
作者给出两个解释。一是上下文稀释:随着工具输出不断累积,最初那条有害请求在上下文里的分量被冲淡,模型不再把它当成需要认真对待的指令。二是安全注意力被挤占:模型的注意力转向「描述工具返回了什么」,而不是优先判断该不该做。
不是只有小模型如此
论文提到,开源模型(如 Qwen3-VL)更容易出现这个问题,但前沿闭源模型同样未能幸免:Claude Opus 4.7、Gemini 3.1 Pro Preview、GPT-5.4 在接工具后,拒答失败也都上升。这打破了「用最强的模型加内置护栏就够了」的假设。
对你自建 Agent 的含义
如果你在搭会调用工具的 Agent,这条结论的直接推论是:安全判断不能只交给模型自带的护栏。更稳的做法是把「该不该做」的判断放在工具调用之前,或者在工具输出回灌之后单独设一道检查,而不是指望模型在长上下文里始终记得最初的约束。换句话说,把护栏从「模型内部」挪一部分到「流程外部」,是这类研究给出的可执行建议。
以为换更强的模型就能解决——研究里前沿闭源模型同样上升。
只在系统提示里写一句「注意安全」,然后指望它在几十轮工具调用后仍生效。
把「相对上升 68.7%」直接当成绝对失败率——它只是变化幅度。
自检清单
常见问题
这条研究的结论是什么?
11 个视觉语言模型在「接工具」时的拒答失败率,都高于「不接工具」时;相对上升最高达 68.7%。作者认为原因是上下文稀释与安全注意力被挤占。
68.7% 是绝对失败率吗?
不是,是相对上升幅度。若原本失败率 10%,相对上升 68.7% 后约 16.9%,即每 100 个请求多漏约 7 个。
开源模型和闭源模型差别大吗?
开源模型(如 Qwen3-VL)更容易触发,但 Claude Opus 4.7、Gemini 3.1 Pro Preview、GPT-5.4 等前沿模型在接工具后拒答失败同样上升。
我该怎么降低风险?
把「该不该做」的判断放到工具调用之前或输出回灌之后,并在高风险动作上设人工确认,而不是只依赖模型自带护栏。
来源参考
以上为外部来源;本文为 RefHub 用自己的结构重写,事实以来源页为准,价格与政策会变,请回源核对当日。
下一步:想理解 Agent 的工具协议,读 MCP 怎么工作;要管住多个 Agent 的配置,看 多 Agent 配置统一。