LLAMA.CPP GPU 指南
llama.cpp GPU 指南:显存、context 与 tok/s
llama.cpp 让本地推理更便携,但一条有用的命令仍取决于模型能否放进显存,以及 GPU 能否足够快地读取权重。
从放得下的模型开始
权重文件不是完整预算。KV cache 会随 context 增长,后端也需要运行时开销,所以不要只比较文件大小,应当使用显存计算。
量化是在显存和精度之间取舍
Q4、Q8 和 FP16 会改变权重显存,也通常会改变 GPU 可运行的模型范围。探索时,计算器会实时保留量化选择。
带宽是速度限制
decode 速度根据显存带宽和模型大小估算;如果目录中有精确组合的实测锚点,就会替换估算值。
准备测试你的机器了吗?
输入 GPU 或可用显存,计算器会根据工作负载、量化和 context 对模型排序。
打开计算器