Tesla P4 8GB 是 NVIDIA 的加速器,配备 8 GB GDDR5,峰值显存带宽约 192 GB/s。 AI Hashrate 按 8K 上下文估算本地 LLM 解码速度(batch 1):能否装下 = 权重 + KV cache + 1 GB 运行时开销,而非只看权重。 Q4 下约有 16 个收录模型能完整装进此卡;FP16 下约 3 个。 Q4 速度前列:MiniCPM5-1B ≈ 113.1 tok/s(估算,装得下); Qwen3.5-2B ≈ 61.1 tok/s(估算,装得下); DeepSeek-R1-0528-Qwen3-8B-layer-mix-bpw-3.8-mlx ≈ 53.1 tok/s(估算,装得下); Llama-3.2-3B-Instruct ≈ 38.2 tok/s(估算,装得下); Qwen3-4B-Instruct-2507 ≈ 30.5 tok/s(估算,装得下)。 相对排名比绝对 tok/s 更可靠。带宽公式与实测锚点政策见方法论页。 方法论.