← AI Hashrate 中文

DeepSeek-R1-0528-Qwen3-8B-layer-mix-bpw-3.8-mlx

GreenBitAI · 2.3B · ctx NoneK · apache-2.0 · HuggingFace

DeepSeek-R1-0528-Qwen3-8B-layer-mix-bpw-3.8-mlx (GreenBitAI) is a 2.3B parameters open-weight model tracked on AI Hashrate. At 8K context we estimate roughly 2.72 GB VRAM for Q4 (weights 1.26 GB + KV 0.46 GB + 1 GB overhead) and 6.06 GB for FP16. About 63 GPUs/accelerators in our catalog fully fit this model at Q4 under that context assumption. Fastest Q4 configs: B200 192GB SXM ≈ 2213.4 tok/s (estimated); MI300X 192GB ≈ 1466.4 tok/s (estimated); H200 141GB SXM5 ≈ 1328.1 tok/s (estimated); H100 80GB SXM5 ≈ 926.9 tok/s (estimated); Gaudi 3 128GB ≈ 906.4 tok/s (estimated). Use the table below for VRAM fit and tok/s per dollar (list MSRP). Estimates follow memory-bandwidth math; measured rows override when present. See methodology for details. Methodology.

126 hardware configs — sorted by tok/s. Default fit context 8K.

HardwareVRAMQuanttok/sFits?tok/s/$
B200 192GB SXM192Q42213.4 est.Yes0.055
MI300X 192GB192Q41466.4 est.Yes0.098
H200 141GB SXM5141Q41328.1 est.Yes0.038
H100 80GB SXM580Q4926.9 est.Yes0.031
Gaudi 3 128GB128Q4906.4 est.Yes0.073
B200 192GB SXM192FP16608.7 est.Yes0.015
A100 80GB SXM480Q4564.2 est.Yes0.038
RTX 5090 32GB32Q4495.8 est.Yes0.248
MI300X 192GB192FP16403.3 est.Yes0.027
H200 141GB SXM5141FP16365.2 est.Yes0.01
RTX 4090 24GB24Q4278.9 est.Yes0.174
RTX 4090D 24GB (China)24Q4278.9 est.Yes0.174
RTX 3090 Ti 24GB24Q4278.9 est.Yes0.14
RTX 5080 16GB16Q4265.6 est.Yes0.266
RX 7900 XTX 24GB24Q4265.6 est.Yes0.266
RTX 6000 Ada 48GB48Q4265.6 est.Yes0.039
RTX 3090 24GB24Q4259.0 est.Yes0.173
H100 80GB SXM580FP16254.9 est.Yes0.008
Gaudi 3 128GB128FP16249.3 est.Yes0.02
V100 32GB SXM232Q4249.0 est.Yes0.025
V100 16GB PCIe16Q4249.0 est.Yes0.031
RTX 5070 Ti 16GB16Q4247.9 est.Yes0.331
L40S 48GB48Q4239.1 est.Yes0.03
Mac Studio M3 Ultra 96GB96Q4226.6 est.Yes0.057
Mac Studio M2 Ultra 192GB192Q4221.3 est.Yes0.032
RX 7900 XT 20GB20Q4221.3 est.Yes0.246
RTX A6000 48GB48Q4212.5 est.Yes0.047
RTX 3080 10GB10Q4210.3 est.Yes0.301
RTX 4080 Super 16GB16Q4203.6 est.Yes0.204
RTX 4070 Ti Super 16GB16Q4185.9 est.Yes0.233
RTX 5070 12GB12Q4185.9 est.Yes0.339
Titan V 12GB12Q4180.6 est.Yes0.06
RX 9070 16GB16Q4177.1 est.Yes0.323
RX 9070 XT 16GB16Q4177.1 est.Yes0.296
RX 7800 XT 16GB16Q4172.6 est.Yes0.346
Arc Pro B70 32GB32Q4168.2 est.Yes0.168
RX 7900 GRE 16GB16Q4159.4 est.Yes0.29
A100 80GB SXM480FP16155.1 est.Yes0.01
Arc A770 16GB16Q4154.9 est.Yes0.444
RTX 4070 Ti 12GB12Q4153.3 est.Yes0.192
Titan Xp 12GB12Q4151.6 est.Yes0.126
MacBook Pro M4 Max 128GB128Q4151.1 est.Yes0.034
RTX 4070 12GB12Q4139.4 est.Yes0.233
RTX 4070 Super 12GB12Q4139.4 est.Yes0.233
DGX Spark (GH200 480GB)480Q4138.3 est.Yes0.046
RTX 5090 32GB32FP16136.3 est.Yes0.068
Titan X Pascal 12GB12Q4132.8 est.Yes0.111
Arc B580 12GB12Q4126.2 est.Yes0.507
RTX 5060 8GB8Q4124.0 est.Yes0.415
RTX 5060 Ti 8GB8Q4124.0 est.Yes0.327
RTX 5060 Ti 16GB16Q4124.0 est.Yes0.289
RTX 3070 8GB8Q4124.0 est.Yes0.248
RX 7700 XT 12GB12Q4119.5 est.Yes0.266
MacBook Pro M1 Max 32GB32Q4110.7 est.Yes0.034
MacBook Pro M1 Max 64GB64Q4110.7 est.Yes0.028
MacBook Pro M3 Max 128GB128Q4110.7 est.Yes0.026
Arc B570 10GB10Q4105.1 est.Yes0.48
RTX 3060 12GB12Q499.6 est.Yes0.303
T4 16GB16Q488.5 est.Yes0.044
RTX 4060 Ti 8GB8Q479.7 est.Yes0.2
RTX 4060 Ti 16GB16Q479.7 est.Yes0.16
RX 7600 8GB8Q479.7 est.Yes0.296
RX 7600 XT 16GB16Q479.7 est.Yes0.242
RTX 4090 24GB24FP1676.7 est.Yes0.048
RTX 4090D 24GB (China)24FP1676.7 est.Yes0.048
RTX 3090 Ti 24GB24FP1676.7 est.Yes0.038
Mac mini M4 Pro 64GB64Q475.5 est.Yes0.034
RTX 4060 8GB8Q475.3 est.Yes0.252
RTX 5080 16GB16FP1673.0 est.Yes0.073
RX 7900 XTX 24GB24FP1673.0 est.Yes0.073
RTX 6000 Ada 48GB48FP1673.0 est.Yes0.011
RTX 3090 24GB24FP1671.2 est.Yes0.047
V100 32GB SXM232FP1668.5 est.Yes0.007
V100 16GB PCIe16FP1668.5 est.Yes0.009
RTX 5070 Ti 16GB16FP1668.2 est.Yes0.091
L40S 48GB48FP1665.7 est.Yes0.008
Mac Studio M3 Ultra 96GB96FP1662.3 est.Yes0.016
Mac Studio M2 Ultra 192GB192FP1660.9 est.Yes0.009
RX 7900 XT 20GB20FP1660.9 est.Yes0.068
Ryzen AI Max+ 395 128GB96Q459.5 est.Yes0.03
Ryzen AI Max+ 395 64GB48Q459.5 est.Yes0.04
Ryzen AI Max 390 64GB48Q459.5 est.Yes0.046
RTX A6000 48GB48FP1658.4 est.Yes0.013
RTX 3080 10GB10FP1657.8 est.Yes0.083
RTX 4080 Super 16GB16FP1656.0 est.Yes0.056
Tesla P4 8GB8Q453.1 est.Yes0.664
RTX 4070 Ti Super 16GB16FP1651.1 est.Yes0.064
RTX 5070 12GB12FP1651.1 est.Yes0.093
Titan V 12GB12FP1649.7 est.Yes0.017
RX 9070 16GB16FP1648.7 est.Yes0.089
RX 9070 XT 16GB16FP1648.7 est.Yes0.081
RX 7800 XT 16GB16FP1647.5 est.Yes0.095
Arc Pro B70 32GB32FP1646.3 est.Yes0.046
RX 7900 GRE 16GB16FP1643.8 est.Yes0.08
Arc A770 16GB16FP1642.6 est.Yes0.122
RTX 4070 Ti 12GB12FP1642.2 est.Yes0.053
Titan Xp 12GB12FP1641.7 est.Yes0.035
MacBook Pro M4 Max 128GB128FP1641.5 est.Yes0.009
RTX 4070 12GB12FP1638.3 est.Yes0.064
RTX 4070 Super 12GB12FP1638.3 est.Yes0.064
DGX Spark (GH200 480GB)480FP1638.0 est.Yes0.013
Titan X Pascal 12GB12FP1636.5 est.Yes0.03
Arc B580 12GB12FP1634.7 est.Yes0.139
RTX 5060 8GB8FP1634.1 est.Yes0.114
RTX 5060 Ti 8GB8FP1634.1 est.Yes0.09
RTX 5060 Ti 16GB16FP1634.1 est.Yes0.079
RTX 3070 8GB8FP1634.1 est.Yes0.068
Mac mini M4 32GB32Q433.2 est.Yes0.033
RX 7700 XT 12GB12FP1632.9 est.Yes0.073
MacBook Pro M1 Max 32GB32FP1630.4 est.Yes0.009
MacBook Pro M1 Max 64GB64FP1630.4 est.Yes0.008
MacBook Pro M3 Max 128GB128FP1630.4 est.Yes0.007
Arc B570 10GB10FP1628.9 est.Yes0.132
RTX 3060 12GB12FP1627.4 est.Yes0.083
T4 16GB16FP1624.3 est.Yes0.012
RTX 4060 Ti 8GB8FP1621.9 est.Yes0.055
RTX 4060 Ti 16GB16FP1621.9 est.Yes0.044
RX 7600 8GB8FP1621.9 est.Yes0.081
RX 7600 XT 16GB16FP1621.9 est.Yes0.067
Mac mini M4 Pro 64GB64FP1620.8 est.Yes0.009
RTX 4060 8GB8FP1620.7 est.Yes0.069
Ryzen AI Max+ 395 128GB96FP1616.4 est.Yes0.008
Ryzen AI Max+ 395 64GB48FP1616.4 est.Yes0.011
Ryzen AI Max 390 64GB48FP1616.4 est.Yes0.013
Tesla P4 8GB8FP1614.6 est.Yes0.182
Mac mini M4 32GB32FP169.1 est.Yes0.009

Fit checks

12 popular retail GPUs; every row in the table above also links its Fits? verdict to the full fit check.