资讯 · 改写稿

老显卡也能跑本地大模型:8GB 显存的一张 2019 年显卡实测

结论先给:本地大模型不吃「最新显卡」这套。一篇实测显示,2019 年的 8GB 老卡只要选对量化档位、配上按需编译的内核,解码速度能追平甚至超过主流框架。

作者在自述里给了一组具体数字:他做的推理栈 Phobos 在一张 2019 年的 RTX 2080 SUPER(8GB 显存)上跑完整推理,所有内核都在运行时从 Phobos 编译,不依赖 cuBLAS 或 CUDA 工具链,只需要显卡驱动。

数字:解码更快,读提示略慢

也就是说,结论不是「全面更快」:小模型的提示处理,Phobos 只有 llama.cpp 的 60–80%。作者也说明,这是他在自己那张卡上测的,换了硬件比例会变。

一个容易被忽略的指标:内存被抢之后

台式机中途拿走 2GiB 内存时,Phobos 靠动态缓存策略保住了约四分之三的解码速度,llama.cpp 只保住约 30%。对「一边跑模型一边干别的」的机器,这比峰值速度更贴近日常。

本站计算:8GB 显存能装多大

本站计算——按站内教程口径,4-bit 量化下每 10 亿参数约占 0.6GB 显存;8GB 卡留七成安全余量约 5.6GB,对应约 9B 参数,再算上上下文占用的缓存,实际能稳跑的多在个位数 B。35B 混合专家能放进去,靠的是极低比特量化加「每次只激活部分专家」,而不是把全部参数都装进显存。

要不要试

如果你手上正好有一张老卡,值得先跑通一个小模型,再往上试;显存与量化档位的关系,见站内教程。别把别人的单卡数字当成你的保证。要留意的是,这类项目多在快速迭代,今天快、明天对手更新一版就可能反超,所以看的是「老硬件能不能用」这件事本身,而不是某一版的胜负。

容易踩的坑

把单卡实测当通用保证:作者自己说明换硬件比例会变。

只比解码不比提示处理:小模型上 Phobos 的提示处理只有对手的六到八成。

忽略内存占用:上下文越长越吃显存,长对话可能比模型本身更占。

一味追大模型:装不下只会反复报错,先跑通小模型更实际。

自检清单

常见问题

8GB 显存能跑多大的模型?

按 4-bit 量化每 10 亿参数约 0.6GB 估算,8GB 卡留出安全余量后大致对应个位数到十位数的 B 级参数;上下文越长越占显存,实际以能稳定运行为准。

Phobos 比 llama.cpp 快吗?

来源实测在 0.8B 与 35B 混合专家模型上解码更快(324 对 247、54 对 30),但在三值 27B 上略慢,且小模型的提示处理只有对手的 60–80%,不是全面领先。

为什么内存被抢之后速度差这么多?

来源称 Phobos 用动态缓存策略,在系统拿走 2GiB 内存时保住约四分之三的解码速度,llama.cpp 只保住约 30%。

这些数字能直接套用到我的机器吗?

作者明确说明是在他自己那张卡上测的,换硬件比例会变;建议先跑自己的基线。

来源参考

以上为外部来源;本文为 RefHub 用自己的结构重写,事实以来源页为准,价格与政策会变,请回源核对当日。

下一步:想先判断要不要自建,读 本地模型 vs 订阅;想按步骤上手,读 本地跑大模型教程。