资讯 · 改写稿
自己编译内核的推理引擎:Magnitude 比 llama.cpp 快在哪
结论先给:Magnitude 的思路是「先量你的机器,再编译内核」——同一台设备上把内核按硬件调优一遍,来源称开源模型跑得比 llama.cpp 快至多 2 倍。它不是新模型,而是换了一台更懂你硬件的引擎。
来源(GitHub 项目 magnitudedev/magnitude,2026-09-30 登上 Hacker News 的 Show HN)把自己定义为一款面向 agent 的开源推理引擎:它会针对你这台机器的具体硬件做自我优化——先在设备上编译并调优内核,再让开源模型跑起来。来源称,这样能让开源模型比 llama.cpp 快至多 2 倍。
它给出的几个数字
- 解码速度:Metal 上提升约 92%,CUDA 上提升约 19%;
- 内核调优:模型跑起来之前,先在你的硬件上把内核调一遍;
- 内存:每个 agent 占用少约 27%,agent 停下时释放;
- 并发会话:多个会话共享前缀缓存,避免互相拖慢;
- 接入:一键连接你已在用的 agent(来源举例 Pi、OpenCode、Hermes、Codex 等);
- 许可与隐私:Apache 2.0、免费开源,来源称「没有 token 费用,数据不出本机」。
来源交代的使用流程很短:下载桌面应用,在 Discover 里挑一个推荐模型下载,再到 Connections 里接入你的 agent,然后就能用;桌面应用自带 magnitude 命令行,不用单独安装。
「自己编译内核」是什么意思
推理引擎的快慢,很大一部分取决于算子内核(kernel)与具体硬件的匹配程度:同一段计算,在不同芯片上最优的写法并不一样。通用引擎为了兼容,往往只能用一套折中的实现;而 Magnitude 选择在模型运行之前,先按这台机器编译、调优一遍内核,因此更容易吃满硬件特性。这也解释了它为什么强调能在 Apple Silicon、NVIDIA、AMD 乃至纯 CPU 上跑——目标是把不同硬件都推到接近上限。
本站计算——把「快 2 倍」折成两种体感:若原本每秒出 20 个 Tokens,2 倍后约 40 个;反过来,生成同样多的字,时间大约减半。再看内存那一项:按「每个 agent 少 27%」估算,若原本一个 agent 占 16GB 显存,优化后约 11.7GB,省下的约 4.3GB 足以再塞进一个更小的模型——对显存吃紧的本地部署来说,这往往比速度更值钱。这也和站内「本地模型跑多快看显存带宽」的结论互补:带宽决定上限,引擎决定你离上限有多近。
选它之前先想清楚
需要提醒的是,「先编译内核」的代价是首次运行要花时间做调优,而且优化效果与硬件绑定——换一台机器就要重新来一遍。另外,来源的对照基准是 llama.cpp,官方给的 2 倍也是「至多」;实际能快多少,仍取决于模型家族与设备组合。把它当成「让现有硬件更接近上限」的工具,比当成「换块卡」的替代品更稳妥。
把它当成新模型:它换的是推理引擎,不是模型本身。
忽略首次调优成本:内核按硬件编译,换机器要重新来一遍。
把「至多 2 倍」当保证:实际提升随模型与硬件组合变化。
常见问题
Magnitude 是什么?
来源称它是一款面向 agent 的开源推理引擎,会针对具体硬件自我优化:先在设备上编译调优内核,再运行开源模型。
它比 llama.cpp 快多少?
来源称开源模型跑得比 llama.cpp 快至多 2 倍,其中 Metal 上解码提升约 92%、CUDA 上约 19%。
它免费吗、数据安全吗?
来源称采用 Apache 2.0、免费开源,没有 token 费用,数据不出本机。
怎么接入现有 agent?
来源称下载桌面应用、在 Discover 选模型、在 Connections 里一键连接(举例 Pi、OpenCode、Hermes、Codex 等),应用自带命令行。
来源参考
以上为外部来源;本文为 RefHub 用自己的结构重写,事实以来源页为准,价格与政策会变,请回源核对当日。
下一步:本地模型跑多快看什么,读 显存带宽决定速度;一张卡跑多个模型,见 本地 LLM 的 GPU 调度。