AI Hashrate

本地大模型显存指南

本地大模型需要多少显存?

显存是本地推理的第一道限制。先从机器实际可用的显存开始,再让计算器同时检查模型大小、量化、context 和工作负载。

模型权重只是显存预算的一部分

模型还需要 KV cache 和运行时开销,KV cache 会随 context 增长。量化可以减少权重显存,但更长的 context 仍可能让模型超出上限。

把 context 当作真实输入

4K 聊天和 32K 编程的显存需求不同。不要只看一个显存数字,应当随着 context 滑块变化重新计算。

放得下之后,带宽决定速度

两张显存容量相同的卡,带宽可能不同。模型放得下以后,计算器会根据带宽估算 decode tok/s;有精确目录实测时则优先显示实测。

目录中的显存档位

显存代表性硬件规划提示
8 GBRTX 4060 8GB · RX 7600 8GB从较小模型和较短 context 开始,确认是否放得下。
16 GBRTX 5060 Ti 16GB · RX 7800 XT 16GB常见容量档位,需要同时测试量化和 context。
24 GBRTX 4090 24GB · RTX 3090 24GB为更大的量化模型或更长 context 留出更多空间。
48 GBL40S 48GB · RTX 6000 Ada 48GB更宽的显存空间,适合探索大模型和长 context。
128 GBMacBook Pro M4 Max 128GB · Gaudi 3 128GB面向超大本地模型;带宽仍会影响 decode 速度。

这些是目录中的代表性输入,并不保证该档位的每个模型都能运行。打开硬件链接可测试具体配置。

准备测试你的机器了吗?

输入 GPU 或可用显存,计算器会根据工作负载、量化和 context 对模型排序。

打开计算器