资讯 · 改写稿

会「做判断」的模型:Jev 用类型化概率替代生成文本

结论先给:软件里大多数判断是「这是哪一类」「这急不急」这种快判断,却常常交给要花几秒、几十秒的生成式模型来做。Jev 的定位就是把这部分换成一次并行的、类型化的判断。

来源介绍的是 TypeSafe AI 的模型 Jev:它不生成文本,而是返回类型化的概率判断。你用程序状态加上若干带类型的问题去问它,它在一次并行调用里把所有问题一起答完,耗时约 70 到 500 毫秒,输入价格 $0.042/百万 token,输出免费。

它把自己定位成「快思考」

来源说 TypeSafe AI 把这类模型叫 System One,取自心理学家卡尼曼对「快、直觉」思维的命名。它的赌注是:软件里绝大多数判断其实是快判断——「这条该归到哪个桶」「这条紧急吗」——而开发者一直被迫租用「慢思考」来完成它们。

来源给出的背景:Jev 于 2026 年 9 月 15 日发布,融资 4000 万美元,由 DCVC 领投;作者之一是 Diogo Almeida,据来源介绍是 RLHF 与 InstructGPT 的共同发明人。

它想替掉的是什么

来源把它和前沿大模型做了对照:前者延迟在 70–500 毫秒,后者是 3 秒到 300 多秒;输入价格上前者是 $0.042/百万 token,后者约 $0.20 到 $10/百万 token;前者返回结构化输出,后者是自由文本。

本站计算——单看输入价格,$0.042 与 $0.20 到 $10 之间差着大约 5 倍到 238 倍;再叠上「一次并行答完多个问题」和毫秒级延迟,省下的主要不是 token 钱,而是等待与工程复杂度。这正好解释了 为什么有人把「Agent 该不该回话」这种判断从大模型里拆出来。

什么时候它不合适

来源是一篇实操向的指南,里面同样强调了失败模式。就判断类任务而言,值得先想清楚的是:需要向人解释理由、需要多步推理、以及判定口径本身说不清的场景——这些都不是「一次并行判断」能覆盖的,硬套只会得到一个看起来严谨、其实难调的结果。

容易踩的坑

把需要多步推理的任务塞给判断类模型:它给的是一次性结果,不是推理过程。

用自由文本接口做结构化判断:还得写解析,容易在返回值上翻车。

在标准本身含糊的场景硬上:结果看着严谨,实际比提示词更难调。

自检清单

常见问题

Jev 是什么?

来源称它是 TypeSafe AI 的模型,返回类型化的概率判断而不是生成文本:你发程序状态加一组带类型的问题,它在一次并行调用里全部回答,耗时约 70 到 500 毫秒。

它和常规大模型的差别在哪?

来源给出三处对照:延迟 70–500 毫秒对 3 秒至 300 多秒;输入价格 $0.042/百万 token 对约 $0.20–10;返回结构化结果对自由文本。

「System One」是什么意思?

来源说 TypeSafe AI 用这个名字指代 Jev 这一类模型,取自卡尼曼对「快、直觉」思维的命名,用来对照需要慢思考的生成式模型。

什么任务不适合它?

需要向人解释理由、需要多步推理、以及判定口径本身说不清的场景,来源建议不要硬套判断类模型。

来源参考

以上为外部来源;本文为 RefHub 用自己的结构重写,事实以来源页为准,价格与政策会变,请回源核对当日。

下一步:Agent 该不该插话怎么判断,读 Agent 接进群之后;接工具后模型的安全边界,见 VLM 接工具后的安全变化。