资讯 · 改写稿
AI Agent 的「反思」模式:生成、自评、改写三步循环
结论先给:反思模式值不值,取决于你的任务能不能用「可验证的标准」打分。能,就值得多花一轮推理;不能,多跑几轮只会更贵、更慢,甚至越改越差。
反思模式是四种主流 Agent 设计模式之一(另外三种是工具调用、规划、多 Agent 协作)。它的思路很朴素:让 Agent 先产出,再自己挑毛病,然后改。这个反馈环更容易发现错误,也能提升输出质量。
三步循环:生成、反思、改写
- 生成:模型先对提示词给出初稿,比如客服场景里对用户问题的第一版回答。它会读取产品文档、公司政策等资源,然后把初稿暂存起来,等自评。
- 反思:让同一个或另一个模型,按开发者预设的标准去批评初稿,比如自问「我有没有考虑到所有公司政策」「这个回答有没有可能有害或错误」。若用工具增强版,还可以去查搜索引擎来核实。
- 改写:把初稿和批评意见一起喂回生成模型,让它据反馈修订,改错、删冗余,产出更高质量的版本。
关键一步是停止条件:开发者必须设定固定轮数之类的边界,否则 Agent 可能陷入无限精修,白烧 token,甚至越过最优点、把质量改坏。合适的停止点能同时压低成本与延迟。
三种变体,取舍不同
- 单模型自省:同一个模型既生成又批评。最简单,但它只能用自己的内部知识评估自己,容易漏错,还可能出现「自我偏好偏差」,把幻觉越描越真。
- 多 Agent 互评:一个 Agent 负责生成,另一个独立 Agent 负责评审,像同行评审。推理过程不同的模型,更容易抓到原模型忽略的错误或幻觉。
- 工具增强:在反思阶段引入外部工具(搜索引擎、数据库)。模型判断自己知识不足时就去查,能更好核实事实,但结果受外部工具或数据准确性影响。
该用与不该用
适合用:输出质量最重要、能用清晰标准或清单衡量对错、且单次生成经常出错的任务。不适合用:对速度敏感(每多一轮就多一次推理与工具调用)、初稿质量已够用、或请求量大到成本吃不消的场景。
本站计算——把成本换算清楚:一轮完整的反思通常把每个请求的模型调用从 1 次增加到 3 次(生成 + 反思 + 改写)。若某服务日均处理 1000 个请求,等于日均调用从 1000 次升到约 3000 次;成本与延迟大致按这个倍数放大(未计缓存与工具调用的额外开销)。
不设停止条件,让 Agent 无限精修——可能烧光 token,还把质量改坏。
只做单模型自省就以为万无一失——它可能漏错,甚至把幻觉强化成「更像真的」。
在高并发、对速度敏感的场景硬上反思——每轮都多一次调用,成本与延迟会明显放大。
自检清单
常见问题
反思模式和普通的「重试」有什么区别?
重试是同样输入再跑一次;反思会把初稿和批评意见一起喂回模型,让它带着反馈修订,而不是从头再来。
为什么要设停止条件?
没有边界时 Agent 可能无限精修,烧掉大量 token,还可能越过最优点、把质量改坏。
单模型自省和多 Agent 互评怎么选?
前者最简单,但受限于模型自己的判断,容易漏错;后者用独立模型评审,更能抓到错误与幻觉,代价是复杂度更高。
反思模式会让成本涨多少?
按一轮生成 + 反思 + 改写估,每个请求的模型调用约从 1 次增到 3 次,成本与延迟大致按此倍数放大。
来源参考
以上为外部来源;本文为 RefHub 用自己的结构重写,事实以来源页为准,价格与政策会变,请回源核对当日。
下一步:想知道 Agent 与普通自动化的差别,读 Agent 与自动化的区别;要理解工具是怎么接进模型的,读 MCP 是怎么工作的。