gemma-4-31B-it-FP8-block(RedHatAI)是 AI Hashrate 收录的31.3B 参数开放权重模型。 按 8K 上下文估算:Q4 约需 24.48 GB VRAM(权重 17.22 GB + KV 6.26 GB + 开销 1 GB),FP16 约需 69.86 GB。 在该上下文假设下,目录中约有 24 款 GPU/加速器能在 Q4 下完整装下此模型。 Q4 最快配置:B200 192GB SXM ≈ 162.6 tok/s(估算); MI300X 192GB ≈ 107.8 tok/s(估算); H200 141GB SXM5 ≈ 97.6 tok/s(估算); H100 80GB SXM5 ≈ 68.1 tok/s(估算); Gaudi 3 128GB ≈ 66.6 tok/s(估算)。 下表给出各硬件的 VRAM 装机情况与每美元 tok/s(按 MSRP 标价)。估算基于显存带宽公式;有实测时以实测为准。详见方法论页。 方法论.