← AI Hashrate 中文

Qwen3.5-122B-A10B-Heretic-v2-MLX-mixed-3.8bit

TheCluster · 19.8B (active NoneB) · MoE · ctx NoneK · apache-2.0 · HuggingFace

Qwen3.5-122B-A10B-Heretic-v2-MLX-mixed-3.8bit (TheCluster) is a 19.8B parameters MoE (19.8B active per token) open-weight model tracked on AI Hashrate. At 8K context we estimate roughly 15.85 GB VRAM for Q4 (weights 10.89 GB + KV 3.96 GB + 1 GB overhead) and 44.56 GB for FP16. About 44 GPUs/accelerators in our catalog fully fit this model at Q4 under that context assumption. Fastest Q4 configs: B200 192GB SXM ≈ 257.1 tok/s (estimated); MI300X 192GB ≈ 170.3 tok/s (estimated); H200 141GB SXM5 ≈ 154.3 tok/s (estimated); H100 80GB SXM5 ≈ 107.7 tok/s (estimated); Gaudi 3 128GB ≈ 105.3 tok/s (estimated). Use the table below for VRAM fit and tok/s per dollar (list MSRP). Estimates follow memory-bandwidth math; measured rows override when present. See methodology for details. Methodology.

117 hardware configs — sorted by tok/s. Default fit context 8K.

HardwareVRAMQuanttok/sFits?tok/s/$
B200 192GB SXM192Q4257.1 est.Yes0.006
MI300X 192GB192Q4170.3 est.Yes0.011
H200 141GB SXM5141Q4154.3 est.Yes0.004
H100 80GB SXM580Q4107.7 est.Yes0.004
Gaudi 3 128GB128Q4105.3 est.Yes0.008
B200 192GB SXM192FP1670.7 est.Yes0.002
A100 80GB SXM480Q465.5 est.Yes0.004
RTX 5090 32GB32Q457.6 est.Yes0.029
MI300X 192GB192FP1646.8 est.Yes0.003
H200 141GB SXM5141FP1642.4 est.Yes0.001
RTX 5070 12GB12Q435.2 est.No0.064
Titan V 12GB12Q434.2 est.No0.011
RTX 4090 24GB24Q432.4 est.Yes0.02
RTX 4090D 24GB (China)24Q432.4 est.Yes0.02
RTX 3090 Ti 24GB24Q432.4 est.Yes0.016
RTX 5080 16GB16Q430.9 est.Yes0.031
RX 7900 XTX 24GB24Q430.9 est.Yes0.031
RTX 6000 Ada 48GB48Q430.9 est.Yes0.005
RTX 3090 24GB24Q430.1 est.Yes0.02
H100 80GB SXM580FP1629.6 est.Yes0.001
RTX 4070 Ti 12GB12Q429.0 est.No0.036
Gaudi 3 128GB128FP1629.0 est.Yes0.002
V100 32GB SXM232Q428.9 est.Yes0.003
V100 16GB PCIe16Q428.9 est.Yes0.004
RTX 5070 Ti 16GB16Q428.8 est.Yes0.038
Titan Xp 12GB12Q428.7 est.No0.024
L40S 48GB48Q427.8 est.Yes0.003
RTX 3080 10GB10Q427.6 est.No0.039
RTX 4070 12GB12Q426.4 est.No0.044
RTX 4070 Super 12GB12Q426.4 est.No0.044
Mac Studio M3 Ultra 96GB96Q426.3 est.Yes0.007
Mac Studio M2 Ultra 192GB192Q425.7 est.Yes0.004
RX 7900 XT 20GB20Q425.7 est.Yes0.029
Titan X Pascal 12GB12Q425.2 est.No0.021
RTX A6000 48GB48Q424.7 est.Yes0.005
Arc B580 12GB12Q423.9 est.No0.096
RTX 4080 Super 16GB16Q423.7 est.Yes0.024
RTX 5090 32GB32FP1623.3 est.No0.012
RX 7700 XT 12GB12Q422.6 est.No0.05
RTX 4070 Ti Super 16GB16Q421.6 est.Yes0.027
RX 9070 16GB16Q420.6 est.Yes0.038
RX 9070 XT 16GB16Q420.6 est.Yes0.034
RX 7800 XT 16GB16Q420.1 est.Yes0.04
Arc Pro B70 32GB32Q419.5 est.Yes0.02
RTX 3060 12GB12Q418.9 est.No0.057
RX 7900 GRE 16GB16Q418.5 est.Yes0.034
A100 80GB SXM480FP1618.0 est.Yes0.001
Arc A770 16GB16Q418.0 est.Yes0.052
MacBook Pro M4 Max 128GB128Q417.5 est.Yes0.004
DGX Spark (GH200 480GB)480Q416.1 est.Yes0.005
RTX 5060 Ti 16GB16Q414.4 est.Yes0.034
Arc B570 10GB10Q413.8 est.No0.063
MacBook Pro M1 Max 32GB32Q412.9 est.Yes0.004
MacBook Pro M1 Max 64GB64Q412.9 est.Yes0.003
MacBook Pro M3 Max 128GB128Q412.9 est.Yes0.003
V100 32GB SXM232FP1611.7 est.No0.001
RTX 5060 8GB8Q410.4 est.No0.035
RTX 5060 Ti 8GB8Q410.4 est.No0.027
RTX 3070 8GB8Q410.4 est.No0.021
T4 16GB16Q410.3 est.Yes0.005
RTX 4060 Ti 16GB16Q49.3 est.Yes0.019
RX 7600 XT 16GB16Q49.3 est.Yes0.028
Mac mini M4 Pro 64GB64Q48.8 est.Yes0.004
RTX 6000 Ada 48GB48FP168.5 est.Yes0.001
Arc Pro B70 32GB32FP167.9 est.No0.008
L40S 48GB48FP167.6 est.Yes0.001
RTX 4090 24GB24FP167.4 est.No0.005
RTX 4090D 24GB (China)24FP167.4 est.No0.005
RTX 3090 Ti 24GB24FP167.4 est.No0.004
Mac Studio M3 Ultra 96GB96FP167.2 est.Yes0.002
Mac Studio M2 Ultra 192GB192FP167.1 est.Yes0.001
RX 7900 XTX 24GB24FP167.0 est.No0.007
Ryzen AI Max+ 395 128GB96Q46.9 est.Yes0.003
Ryzen AI Max+ 395 64GB48Q46.9 est.Yes0.005
Ryzen AI Max 390 64GB48Q46.9 est.Yes0.005
RTX 3090 24GB24FP166.8 est.No0.005
RTX A6000 48GB48FP166.8 est.Yes0.002
RTX 4060 Ti 8GB8Q46.7 est.No0.017
RX 7600 8GB8Q46.7 est.No0.025
RTX 4060 8GB8Q46.3 est.No0.021
MacBook Pro M1 Max 32GB32FP165.2 est.No0.002
MacBook Pro M4 Max 128GB128FP164.8 est.Yes0.001
Tesla P4 8GB8Q44.5 est.No0.056
DGX Spark (GH200 480GB)480FP164.4 est.Yes0.001
RX 7900 XT 20GB20FP164.1 est.No0.005
Mac mini M4 32GB32Q43.9 est.Yes0.004
MacBook Pro M1 Max 64GB64FP163.5 est.Yes0.001
MacBook Pro M3 Max 128GB128FP163.5 est.Yes0.001
RTX 5080 16GB16FP163.1 est.No0.003
V100 16GB PCIe16FP162.9 est.No0.0
RTX 5070 Ti 16GB16FP162.9 est.No0.004
RTX 4080 Super 16GB16FP162.4 est.No0.002
Mac mini M4 Pro 64GB64FP162.4 est.Yes0.001
RTX 4070 Ti Super 16GB16FP162.2 est.No0.003
RX 9070 16GB16FP162.1 est.No0.004
RX 9070 XT 16GB16FP162.1 est.No0.004
RX 7800 XT 16GB16FP162.0 est.No0.004
RX 7900 GRE 16GB16FP161.9 est.No0.003
Ryzen AI Max+ 395 128GB96FP161.9 est.Yes0.001
Ryzen AI Max+ 395 64GB48FP161.9 est.Yes0.001
Ryzen AI Max 390 64GB48FP161.9 est.Yes0.001
Arc A770 16GB16FP161.8 est.No0.005
Mac mini M4 32GB32FP161.6 est.No0.002
RTX 5060 Ti 16GB16FP161.5 est.No0.003
RTX 5070 12GB12FP161.2 est.No0.002
Titan V 12GB12FP161.2 est.No0.0
RTX 4070 Ti 12GB12FP161.0 est.No0.001
T4 16GB16FP161.0 est.No0.001
Titan Xp 12GB12FP161.0 est.No0.001
RTX 4070 12GB12FP160.9 est.No0.002
RTX 4060 Ti 16GB16FP160.9 est.No0.002
RTX 4070 Super 12GB12FP160.9 est.No0.002
Titan X Pascal 12GB12FP160.9 est.No0.001
RX 7600 XT 16GB16FP160.9 est.No0.003
RX 7700 XT 12GB12FP160.8 est.No0.002
Arc B580 12GB12FP160.8 est.No0.003
RTX 3060 12GB12FP160.7 est.No0.002

Fit checks

12 popular retail GPUs; every row in the table above also links its Fits? verdict to the full fit check.