AI Hashrate

LLAMA.CPP GPU 指南

llama.cpp GPU 指南:显存、context 与 tok/s

llama.cpp 让本地推理更便携,但一条有用的命令仍取决于模型能否放进显存,以及 GPU 能否足够快地读取权重。

从放得下的模型开始

权重文件不是完整预算。KV cache 会随 context 增长,后端也需要运行时开销,所以不要只比较文件大小,应当使用显存计算。

量化是在显存和精度之间取舍

Q4、Q8 和 FP16 会改变权重显存,也通常会改变 GPU 可运行的模型范围。探索时,计算器会实时保留量化选择。

带宽是速度限制

decode 速度根据显存带宽和模型大小估算;如果目录中有精确组合的实测锚点,就会替换估算值。

准备测试你的机器了吗?

输入 GPU 或可用显存,计算器会根据工作负载、量化和 context 对模型排序。

打开计算器