← AI Hashrate 中文

OLMo-2-1124-13B-Instruct

allenai · 13.7B · ctx NoneK · apache-2.0 · HuggingFace

OLMo-2-1124-13B-Instruct (allenai) is a 13.7B parameters open-weight model tracked on AI Hashrate. At 8K context we estimate roughly 11.28 GB VRAM for Q4 (weights 7.54 GB + KV 2.74 GB + 1 GB overhead) and 31.14 GB for FP16. About 52 GPUs/accelerators in our catalog fully fit this model at Q4 under that context assumption. Fastest Q4 configs: B200 192GB SXM ≈ 371.6 tok/s (estimated); MI300X 192GB ≈ 246.2 tok/s (estimated); H200 141GB SXM5 ≈ 223.0 tok/s (estimated); H100 80GB SXM5 ≈ 155.6 tok/s (estimated); Gaudi 3 128GB ≈ 152.2 tok/s (estimated). Use the table below for VRAM fit and tok/s per dollar (list MSRP). Estimates follow memory-bandwidth math; measured rows override when present. See methodology for details. Methodology.

122 hardware configs — sorted by tok/s. Default fit context 8K.

HardwareVRAMQuanttok/sFits?tok/s/$
B200 192GB SXM192Q4371.6 est.Yes0.009
MI300X 192GB192Q4246.2 est.Yes0.016
H200 141GB SXM5141Q4223.0 est.Yes0.006
H100 80GB SXM580Q4155.6 est.Yes0.005
Gaudi 3 128GB128Q4152.2 est.Yes0.012
B200 192GB SXM192FP16102.2 est.Yes0.003
A100 80GB SXM480Q494.7 est.Yes0.006
RTX 5090 32GB32Q483.2 est.Yes0.042
RTX 3080 10GB10Q478.9 est.No0.113
MI300X 192GB192FP1667.7 est.Yes0.005
H200 141GB SXM5141FP1661.3 est.Yes0.002
RTX 4090 24GB24Q446.8 est.Yes0.029
RTX 4090D 24GB (China)24Q446.8 est.Yes0.029
RTX 3090 Ti 24GB24Q446.8 est.Yes0.023
RTX 5080 16GB16Q444.6 est.Yes0.045
RX 7900 XTX 24GB24Q444.6 est.Yes0.045
RTX 6000 Ada 48GB48Q444.6 est.Yes0.007
RTX 3090 24GB24Q443.5 est.Yes0.029
H100 80GB SXM580FP1642.8 est.Yes0.001
Gaudi 3 128GB128FP1641.8 est.Yes0.003
RTX 5070 Ti 16GB16Q441.6 est.Yes0.056
L40S 48GB48Q440.1 est.Yes0.005
Arc B570 10GB10Q439.4 est.No0.18
Mac Studio M3 Ultra 96GB96Q438.0 est.Yes0.01
Mac Studio M2 Ultra 192GB192Q437.2 est.Yes0.005
RX 7900 XT 20GB20Q437.2 est.Yes0.041
RTX A6000 48GB48Q435.7 est.Yes0.008
RTX 4080 Super 16GB16Q434.2 est.Yes0.034
RTX 4070 Ti Super 16GB16Q431.2 est.Yes0.039
RTX 5070 12GB12Q431.2 est.Yes0.057
Titan V 12GB12Q430.3 est.Yes0.01
RTX 5060 8GB8Q429.7 est.No0.099
RTX 5060 Ti 8GB8Q429.7 est.No0.078
RTX 3070 8GB8Q429.7 est.No0.06
RX 9070 16GB16Q429.7 est.Yes0.054
RX 9070 XT 16GB16Q429.7 est.Yes0.05
RX 7800 XT 16GB16Q429.0 est.Yes0.058
Arc Pro B70 32GB32Q428.2 est.Yes0.028
RX 7900 GRE 16GB16Q426.8 est.Yes0.049
A100 80GB SXM480FP1626.0 est.Yes0.002
Arc A770 16GB16Q426.0 est.Yes0.074
RTX 4070 Ti 12GB12Q425.7 est.Yes0.032
Titan Xp 12GB12Q425.5 est.Yes0.021
MacBook Pro M4 Max 128GB128Q425.4 est.Yes0.006
RTX 4070 12GB12Q423.4 est.Yes0.039
RTX 4070 Super 12GB12Q423.4 est.Yes0.039
DGX Spark (GH200 480GB)480Q423.2 est.Yes0.008
RTX 5090 32GB32FP1622.9 est.Yes0.011
Titan X Pascal 12GB12Q422.3 est.Yes0.019
RTX 4090 24GB24FP1621.8 est.No0.014
RTX 4090D 24GB (China)24FP1621.8 est.No0.014
RTX 3090 Ti 24GB24FP1621.8 est.No0.011
Arc B580 12GB12Q421.2 est.Yes0.085
RX 7900 XTX 24GB24FP1620.8 est.No0.021
RTX 5060 Ti 16GB16Q420.8 est.Yes0.048
RTX 3090 24GB24FP1620.2 est.No0.013
RX 7700 XT 12GB12Q420.1 est.Yes0.045
RTX 4060 Ti 8GB8Q419.1 est.No0.048
RX 7600 8GB8Q419.1 est.No0.071
MacBook Pro M1 Max 32GB32Q418.6 est.Yes0.006
MacBook Pro M1 Max 64GB64Q418.6 est.Yes0.005
MacBook Pro M3 Max 128GB128Q418.6 est.Yes0.004
RTX 4060 8GB8Q418.0 est.No0.06
RTX 3060 12GB12Q416.7 est.Yes0.051
T4 16GB16Q414.9 est.Yes0.007
RTX 4060 Ti 16GB16Q413.4 est.Yes0.027
RX 7600 XT 16GB16Q413.4 est.Yes0.041
Tesla P4 8GB8Q412.7 est.No0.159
Mac mini M4 Pro 64GB64Q412.7 est.Yes0.006
RTX 6000 Ada 48GB48FP1612.3 est.Yes0.002
RX 7900 XT 20GB20FP1612.0 est.No0.013
L40S 48GB48FP1611.0 est.Yes0.001
Mac Studio M3 Ultra 96GB96FP1610.5 est.Yes0.003
Mac Studio M2 Ultra 192GB192FP1610.2 est.Yes0.001
Ryzen AI Max+ 395 128GB96Q410.0 est.Yes0.005
Ryzen AI Max+ 395 64GB48Q410.0 est.Yes0.007
Ryzen AI Max 390 64GB48Q410.0 est.Yes0.008
RTX A6000 48GB48FP169.8 est.Yes0.002
RTX 5080 16GB16FP169.2 est.No0.009
RTX 5070 Ti 16GB16FP168.6 est.No0.011
Arc Pro B70 32GB32FP167.8 est.Yes0.008
RTX 4080 Super 16GB16FP167.1 est.No0.007
MacBook Pro M4 Max 128GB128FP167.0 est.Yes0.002
RTX 4070 Ti Super 16GB16FP166.5 est.No0.008
DGX Spark (GH200 480GB)480FP166.4 est.Yes0.002
RX 9070 16GB16FP166.1 est.No0.011
RX 9070 XT 16GB16FP166.1 est.No0.01
RX 7800 XT 16GB16FP166.0 est.No0.012
Mac mini M4 32GB32Q45.6 est.Yes0.006
RX 7900 GRE 16GB16FP165.5 est.No0.01
Arc A770 16GB16FP165.4 est.No0.015
MacBook Pro M1 Max 32GB32FP165.1 est.Yes0.002
MacBook Pro M1 Max 64GB64FP165.1 est.Yes0.001
MacBook Pro M3 Max 128GB128FP165.1 est.Yes0.001
RTX 5060 Ti 16GB16FP164.3 est.No0.01
RTX 5070 12GB12FP163.6 est.No0.007
Titan V 12GB12FP163.5 est.No0.001
Mac mini M4 Pro 64GB64FP163.5 est.Yes0.002
T4 16GB16FP163.1 est.No0.002
RTX 4070 Ti 12GB12FP163.0 est.No0.004
Titan Xp 12GB12FP163.0 est.No0.003
RTX 3080 10GB10FP162.8 est.No0.004
RTX 4060 Ti 16GB16FP162.8 est.No0.006
RX 7600 XT 16GB16FP162.8 est.No0.009
RTX 4070 12GB12FP162.7 est.No0.005
RTX 4070 Super 12GB12FP162.7 est.No0.005
Ryzen AI Max+ 395 128GB96FP162.7 est.Yes0.001
Ryzen AI Max+ 395 64GB48FP162.7 est.Yes0.002
Ryzen AI Max 390 64GB48FP162.7 est.Yes0.002
Titan X Pascal 12GB12FP162.6 est.No0.002
Arc B580 12GB12FP162.5 est.No0.01
RX 7700 XT 12GB12FP162.3 est.No0.005
RTX 3060 12GB12FP161.9 est.No0.006
Mac mini M4 32GB32FP161.5 est.Yes0.002
Arc B570 10GB10FP161.4 est.No0.006
RTX 5060 8GB8FP161.1 est.No0.004
RTX 5060 Ti 8GB8FP161.1 est.No0.003
RTX 3070 8GB8FP161.1 est.No0.002
RTX 4060 8GB8FP160.7 est.No0.002
RTX 4060 Ti 8GB8FP160.7 est.No0.002
RX 7600 8GB8FP160.7 est.No0.003
Tesla P4 8GB8FP160.5 est.No0.006

Fit checks

12 popular retail GPUs; every row in the table above also links its Fits? verdict to the full fit check.