← AI Hashrate 中文

gemma-4-31B-it-FP8-block

RedHatAI · 31.3B · ctx NoneK · apache-2.0 · HuggingFace

gemma-4-31B-it-FP8-block (RedHatAI) is a 31.3B parameters open-weight model tracked on AI Hashrate. At 8K context we estimate roughly 24.48 GB VRAM for Q4 (weights 17.22 GB + KV 6.26 GB + 1 GB overhead) and 69.86 GB for FP16. About 24 GPUs/accelerators in our catalog fully fit this model at Q4 under that context assumption. Fastest Q4 configs: B200 192GB SXM ≈ 162.6 tok/s (estimated); MI300X 192GB ≈ 107.8 tok/s (estimated); H200 141GB SXM5 ≈ 97.6 tok/s (estimated); H100 80GB SXM5 ≈ 68.1 tok/s (estimated); Gaudi 3 128GB ≈ 66.6 tok/s (estimated). Use the table below for VRAM fit and tok/s per dollar (list MSRP). Estimates follow memory-bandwidth math; measured rows override when present. See methodology for details. Methodology.

93 hardware configs — sorted by tok/s. Default fit context 8K.

HardwareVRAMQuanttok/sFits?tok/s/$
B200 192GB SXM192Q4162.6 est.Yes0.004
MI300X 192GB192Q4107.8 est.Yes0.007
H200 141GB SXM5141Q497.6 est.Yes0.003
H100 80GB SXM580Q468.1 est.Yes0.002
Gaudi 3 128GB128Q466.6 est.Yes0.005
RTX 4090 24GB24Q456.2 est.No0.035
RTX 4090D 24GB (China)24Q456.2 est.No0.035
RTX 3090 Ti 24GB24Q456.2 est.No0.028
RX 7900 XTX 24GB24Q453.5 est.No0.054
RTX 3090 24GB24Q452.2 est.No0.035
B200 192GB SXM192FP1644.7 est.Yes0.001
A100 80GB SXM480Q441.5 est.Yes0.003
RTX 5090 32GB32Q436.4 est.Yes0.018
RX 7900 XT 20GB20Q430.9 est.No0.034
MI300X 192GB192FP1629.6 est.Yes0.002
H200 141GB SXM5141FP1626.8 est.Yes0.001
RTX 5080 16GB16Q423.7 est.No0.024
V100 16GB PCIe16Q422.3 est.No0.003
RTX 5070 Ti 16GB16Q422.2 est.No0.03
RTX 6000 Ada 48GB48Q419.5 est.Yes0.003
H100 80GB SXM580FP1618.7 est.Yes0.001
V100 32GB SXM232Q418.3 est.Yes0.002
Gaudi 3 128GB128FP1618.3 est.Yes0.001
RTX 4080 Super 16GB16Q418.2 est.No0.018
L40S 48GB48Q417.6 est.Yes0.002
Mac Studio M3 Ultra 96GB96Q416.7 est.Yes0.004
RTX 4070 Ti Super 16GB16Q416.6 est.No0.021
Mac Studio M2 Ultra 192GB192Q416.3 est.Yes0.002
RX 9070 16GB16Q415.8 est.No0.029
RX 9070 XT 16GB16Q415.8 est.No0.026
RTX A6000 48GB48Q415.6 est.Yes0.003
RX 7800 XT 16GB16Q415.4 est.No0.031
RX 7900 GRE 16GB16Q414.2 est.No0.026
Arc A770 16GB16Q413.9 est.No0.04
Arc Pro B70 32GB32Q412.4 est.Yes0.012
A100 80GB SXM480FP1611.4 est.Yes0.001
MacBook Pro M4 Max 128GB128Q411.1 est.Yes0.003
RTX 5060 Ti 16GB16Q411.1 est.No0.026
DGX Spark (GH200 480GB)480Q410.2 est.Yes0.003
RTX 5070 12GB12Q49.3 est.No0.017
Titan V 12GB12Q49.1 est.No0.003
MacBook Pro M1 Max 32GB32Q48.1 est.Yes0.002
MacBook Pro M1 Max 64GB64Q48.1 est.Yes0.002
MacBook Pro M3 Max 128GB128Q48.1 est.Yes0.002
T4 16GB16Q47.9 est.No0.004
RTX 4070 Ti 12GB12Q47.7 est.No0.01
Titan Xp 12GB12Q47.6 est.No0.006
RTX 3080 10GB10Q47.3 est.No0.01
RTX 6000 Ada 48GB48FP167.2 est.No0.001
RTX 4060 Ti 16GB16Q47.1 est.No0.014
RX 7600 XT 16GB16Q47.1 est.No0.022
RTX 4070 12GB12Q47.0 est.No0.012
RTX 4070 Super 12GB12Q47.0 est.No0.012
Titan X Pascal 12GB12Q46.7 est.No0.006
L40S 48GB48FP166.5 est.No0.001
Arc B580 12GB12Q46.3 est.No0.025
RTX 5090 32GB32FP166.0 est.No0.003
RX 7700 XT 12GB12Q46.0 est.No0.013
RTX A6000 48GB48FP165.8 est.No0.001
Mac mini M4 Pro 64GB64Q45.6 est.Yes0.003
MacBook Pro M1 Max 64GB64FP165.4 est.No0.001
RTX 3060 12GB12Q45.0 est.No0.015
Mac Studio M3 Ultra 96GB96FP164.6 est.Yes0.001
Mac Studio M2 Ultra 192GB192FP164.5 est.Yes0.001
Ryzen AI Max+ 395 128GB96Q44.4 est.Yes0.002
Ryzen AI Max+ 395 64GB48Q44.4 est.Yes0.003
Ryzen AI Max 390 64GB48Q44.4 est.Yes0.003
Arc B570 10GB10Q43.7 est.No0.017
Mac mini M4 Pro 64GB64FP163.7 est.No0.002
MacBook Pro M4 Max 128GB128FP163.1 est.Yes0.001
V100 32GB SXM232FP163.0 est.No0.0
RTX 5060 8GB8Q42.8 est.No0.009
RTX 5060 Ti 8GB8Q42.8 est.No0.007
RTX 3070 8GB8Q42.8 est.No0.006
DGX Spark (GH200 480GB)480FP162.8 est.Yes0.001
Mac mini M4 32GB32Q42.4 est.Yes0.002
MacBook Pro M3 Max 128GB128FP162.2 est.Yes0.001
Arc Pro B70 32GB32FP162.0 est.No0.002
RTX 4090 24GB24FP161.9 est.No0.001
RTX 4090D 24GB (China)24FP161.9 est.No0.001
RTX 3090 Ti 24GB24FP161.9 est.No0.001
RTX 3090 24GB24FP161.8 est.No0.001
RX 7900 XTX 24GB24FP161.8 est.No0.002
RTX 4060 Ti 8GB8Q41.8 est.No0.005
RX 7600 8GB8Q41.8 est.No0.007
RTX 4060 8GB8Q41.7 est.No0.006
Ryzen AI Max+ 395 64GB48FP161.6 est.No0.001
Ryzen AI Max 390 64GB48FP161.6 est.No0.001
MacBook Pro M1 Max 32GB32FP161.3 est.No0.0
Tesla P4 8GB8Q41.2 est.No0.015
Ryzen AI Max+ 395 128GB96FP161.2 est.Yes0.001
RX 7900 XT 20GB20FP161.0 est.No0.001
Mac mini M4 32GB32FP160.4 est.No0.0

Fit checks

12 popular retail GPUs; every row in the table above also links its Fits? verdict to the full fit check.