资讯 · 改写稿
选分析 Agent 的模型:8 个 LLM 实测,便宜 25 倍不等于少答 20 分
厂商自带的跑分测不出「在你的业务定义上答得对不对」。一家做分析 Agent 的公司干脆自建了一套可复跑的基准,公开了方法、分数与每题的美元成本。
当分析 Agent 答错时,原因通常有三种:上下文里根本没有正确信息、信息在但 Agent 没找到、或者找到了却被模型读错写错。前两种靠「把上下文做对、做得好找」解决,第三种取决于模型,而且每次发版都可能变。所以每次新模型出来,都要重新回答同一个问题:要不要换掉 Agent 背后的模型?
怎么测
基准由两部分组成:30 道基于公开 F1 数据库的题(来自学术基准 Spider 2.0,schema 小且有文档),以及 60 道贴近真实用法的业务题。业务题跑在很大的业务 schema 上,题面给的定义、指标与规则远超模型的上下文窗口,Agent 必须自己去找。业务题没有数据,改用 LLM 判官比较生成的 SQL 与参考答案是否等价。为了量出「取数骨架」的作用,每个模型还额外跑了一遍「不用骨架、只用纯文本搜索读上下文」的对照。
结果
业务题上 Sonnet 5.5 第一:75% 正确、每题 0.12 美元;最贵的 Fable 5.1 只有 53%、每题 0.57 美元。F1 题太容易,大多数模型接近满分——Sonnet 5、Sonnet 5.5 与 Fable 5.1 各自在 25 道可答题上三跑全中 75 个结果;GPT-6 Luna、GPT-6 Sol 与 Opus 5.5 各 72/75(96%),GPT-6 Astra 69/75(92%),GPT-6.1 Sol 66/75(88%)。作者提醒:25 道题上差几个点不算显著。业务题则把模型拉开了,分数从 38% 铺到 75%。
骨架的作用很实在:业务题上给 Sonnet 5.5 加 10 分(65%→75%),GPT-6.1 Sol 加 11 分,GPT-6 Astra 加 15 分;Fable 5.1 是例外,58% 反而降到 53%,作者说暂时解释不了。他们还发现「努力档」并非越高越好:Sonnet 5.5 低努力 82.4%(每题 0.1154 美元)高于中努力 75.3%(0.1237 美元)。
本站计算:GPT-6 Luna 每题只要 0.0049 美元,约为 Sonnet 5.5 的 1/25,但少答对约 20 个百分点。按每天 1,000 题算,Sonnet 5.5 约 124 美元/天,Luna 约 4.9 美元/天——差约 119 美元/天换 20 个百分点的正确率,值不值取决于你答错一次要付多大代价。
只看厂商跑分就换模型——那测的不是你的业务定义与数据形状。
把「贵」等同于「强」——实测里最贵的模型正确率最低。
默认努力档越高越好——低努力档在个别模型上反而更准也更便宜。
自检清单
下一步:想压 API 账单,读 LLM 成本 5 步;想给编码 Agent 记账,读 按客户分摊账单。
常见问题
业务题上哪个模型最好?
作者实测 Sonnet 5.5 以 75% 正确率居首、每题 0.12 美元;最贵的 Fable 5.1 为 53%、每题 0.57 美元。
「取数骨架」值多少分?
业务题上给 Sonnet 5.5 加 10 分、GPT-6.1 Sol 加 11 分、GPT-6 Astra 加 15 分;Fable 5.1 是例外,反而降了 5 分。
便宜模型差在哪?
GPT-6 Luna 每题约 0.0049 美元,是 Sonnet 5.5 的约 1/25,但正确率少约 20 个百分点。
来源参考
以上为外部来源;本文为 RefHub 用自己的结构重写,事实以来源页为准,价格与政策会变,请回源核对当日。
下一步:压 API 账单读 LLM 成本 5 步;按客户记账读 按客户分摊账单。