本地大模型显存指南
本地大模型需要多少显存?
显存是本地推理的第一道限制。先从机器实际可用的显存开始,再让计算器同时检查模型大小、量化、context 和工作负载。
模型权重只是显存预算的一部分
模型还需要 KV cache 和运行时开销,KV cache 会随 context 增长。量化可以减少权重显存,但更长的 context 仍可能让模型超出上限。
把 context 当作真实输入
4K 聊天和 32K 编程的显存需求不同。不要只看一个显存数字,应当随着 context 滑块变化重新计算。
放得下之后,带宽决定速度
两张显存容量相同的卡,带宽可能不同。模型放得下以后,计算器会根据带宽估算 decode tok/s;有精确目录实测时则优先显示实测。
目录中的显存档位
| 显存 | 代表性硬件 | 规划提示 |
|---|---|---|
| 8 GB | RTX 4060 8GB · RX 7600 8GB | 从较小模型和较短 context 开始,确认是否放得下。 |
| 16 GB | RTX 5060 Ti 16GB · RX 7800 XT 16GB | 常见容量档位,需要同时测试量化和 context。 |
| 24 GB | RTX 4090 24GB · RTX 3090 24GB | 为更大的量化模型或更长 context 留出更多空间。 |
| 48 GB | L40S 48GB · RTX 6000 Ada 48GB | 更宽的显存空间,适合探索大模型和长 context。 |
| 128 GB | MacBook Pro M4 Max 128GB · Gaudi 3 128GB | 面向超大本地模型;带宽仍会影响 decode 速度。 |
这些是目录中的代表性输入,并不保证该档位的每个模型都能运行。打开硬件链接可测试具体配置。
准备测试你的机器了吗?
输入 GPU 或可用显存,计算器会根据工作负载、量化和 context 对模型排序。
打开计算器