资讯 · 改写稿
老显卡也能跑本地大模型:8GB 显存的一张 2019 年显卡实测
结论先给:本地大模型不吃「最新显卡」这套。一篇实测显示,2019 年的 8GB 老卡只要选对量化档位、配上按需编译的内核,解码速度能追平甚至超过主流框架。
作者在自述里给了一组具体数字:他做的推理栈 Phobos 在一张 2019 年的 RTX 2080 SUPER(8GB 显存)上跑完整推理,所有内核都在运行时从 Phobos 编译,不依赖 cuBLAS 或 CUDA 工具链,只需要显卡驱动。
数字:解码更快,读提示略慢
- 0.8B 模型:Phobos 324 Tokens/秒,对比 llama.cpp 247。
- 35B 混合专家模型:54 对 30。
- 一个三值(ternary)27B:作者称对方最新的 llama.cpp 分支解码快 7%(49 对 45),但 Phobos 读提示快 1.24 倍。
- 另一个多模态模型上,llama.cpp 解码快 6%。
也就是说,结论不是「全面更快」:小模型的提示处理,Phobos 只有 llama.cpp 的 60–80%。作者也说明,这是他在自己那张卡上测的,换了硬件比例会变。
一个容易被忽略的指标:内存被抢之后
台式机中途拿走 2GiB 内存时,Phobos 靠动态缓存策略保住了约四分之三的解码速度,llama.cpp 只保住约 30%。对「一边跑模型一边干别的」的机器,这比峰值速度更贴近日常。
本站计算:8GB 显存能装多大
本站计算——按站内教程口径,4-bit 量化下每 10 亿参数约占 0.6GB 显存;8GB 卡留七成安全余量约 5.6GB,对应约 9B 参数,再算上上下文占用的缓存,实际能稳跑的多在个位数 B。35B 混合专家能放进去,靠的是极低比特量化加「每次只激活部分专家」,而不是把全部参数都装进显存。
要不要试
如果你手上正好有一张老卡,值得先跑通一个小模型,再往上试;显存与量化档位的关系,见站内教程。别把别人的单卡数字当成你的保证。要留意的是,这类项目多在快速迭代,今天快、明天对手更新一版就可能反超,所以看的是「老硬件能不能用」这件事本身,而不是某一版的胜负。
把单卡实测当通用保证:作者自己说明换硬件比例会变。
只比解码不比提示处理:小模型上 Phobos 的提示处理只有对手的六到八成。
忽略内存占用:上下文越长越吃显存,长对话可能比模型本身更占。
一味追大模型:装不下只会反复报错,先跑通小模型更实际。
自检清单
常见问题
8GB 显存能跑多大的模型?
按 4-bit 量化每 10 亿参数约 0.6GB 估算,8GB 卡留出安全余量后大致对应个位数到十位数的 B 级参数;上下文越长越占显存,实际以能稳定运行为准。
Phobos 比 llama.cpp 快吗?
来源实测在 0.8B 与 35B 混合专家模型上解码更快(324 对 247、54 对 30),但在三值 27B 上略慢,且小模型的提示处理只有对手的 60–80%,不是全面领先。
为什么内存被抢之后速度差这么多?
来源称 Phobos 用动态缓存策略,在系统拿走 2GiB 内存时保住约四分之三的解码速度,llama.cpp 只保住约 30%。
这些数字能直接套用到我的机器吗?
作者明确说明是在他自己那张卡上测的,换硬件比例会变;建议先跑自己的基线。
来源参考
以上为外部来源;本文为 RefHub 用自己的结构重写,事实以来源页为准,价格与政策会变,请回源核对当日。
下一步:想先判断要不要自建,读 本地模型 vs 订阅;想按步骤上手,读 本地跑大模型教程。