qwen35b-a3b-fable-sft-abliterated (hotdogs) is a 34.7B parameters MoE (3.0B active per token) open-weight model tracked on AI Hashrate. At 8K context we estimate roughly 20.69 GB VRAM for Q4 (weights 19.09 GB + KV 0.6 GB + 1 GB overhead) and 71.0 GB for FP16. About 28 GPUs/accelerators in our catalog fully fit this model at Q4 under that context assumption. Fastest Q4 configs: B200 192GB SXM ≈ 1697.0 tok/s (estimated); MI300X 192GB ≈ 1124.2 tok/s (estimated); H200 141GB SXM5 ≈ 1018.2 tok/s (estimated); H100 80GB SXM5 ≈ 710.6 tok/s (estimated); Gaudi 3 128GB ≈ 694.9 tok/s (estimated). Use the table below for VRAM fit and tok/s per dollar (list MSRP). Estimates follow memory-bandwidth math; measured rows override when present. See methodology for details. Methodology.
| Hardware | VRAM | Quant | tok/s | Fits? | tok/s/$ |
|---|---|---|---|---|---|
| B200 192GB SXM | 192 | Q4 | 1697.0 est. | Yes | 0.042 |
| MI300X 192GB | 192 | Q4 | 1124.2 est. | Yes | 0.075 |
| H200 141GB SXM5 | 141 | Q4 | 1018.2 est. | Yes | 0.029 |
| H100 80GB SXM5 | 80 | Q4 | 710.6 est. | Yes | 0.024 |
| Gaudi 3 128GB | 128 | Q4 | 694.9 est. | Yes | 0.056 |
| B200 192GB SXM | 192 | FP16 | 466.7 est. | Yes | 0.012 |
| RX 7900 XT 20GB | 20 | Q4 | 451.9 est. | No | 0.503 |
| A100 80GB SXM4 | 80 | Q4 | 432.5 est. | Yes | 0.029 |
| RTX 5090 32GB | 32 | Q4 | 380.1 est. | Yes | 0.19 |
| RTX 5080 16GB | 16 | Q4 | 346.9 est. | No | 0.347 |
| RTX 5070 Ti 16GB | 16 | Q4 | 323.7 est. | No | 0.432 |
| MI300X 192GB | 192 | FP16 | 309.2 est. | Yes | 0.021 |
| H200 141GB SXM5 | 141 | FP16 | 280.0 est. | Yes | 0.008 |
| RTX 4080 Super 16GB | 16 | Q4 | 265.9 est. | No | 0.266 |
| RTX 4070 Ti Super 16GB | 16 | Q4 | 242.8 est. | No | 0.304 |
| RX 9070 16GB | 16 | Q4 | 231.2 est. | No | 0.421 |
| RX 9070 XT 16GB | 16 | Q4 | 231.2 est. | No | 0.386 |
| RX 7800 XT 16GB | 16 | Q4 | 225.5 est. | No | 0.452 |
| RTX 4090 24GB | 24 | Q4 | 213.8 est. | Yes | 0.134 |
| RTX 4090D 24GB (China) | 24 | Q4 | 213.8 est. | Yes | 0.134 |
| RTX 3090 Ti 24GB | 24 | Q4 | 213.8 est. | Yes | 0.107 |
| RX 7900 GRE 16GB | 16 | Q4 | 208.1 est. | No | 0.379 |
| RX 7900 XTX 24GB | 24 | Q4 | 203.6 est. | Yes | 0.204 |
| RTX 6000 Ada 48GB | 48 | Q4 | 203.6 est. | Yes | 0.03 |
| Arc A770 16GB | 16 | Q4 | 202.3 est. | No | 0.58 |
| RTX 3090 24GB | 24 | Q4 | 198.5 est. | Yes | 0.132 |
| H100 80GB SXM5 | 80 | FP16 | 195.4 est. | Yes | 0.007 |
| Gaudi 3 128GB | 128 | FP16 | 191.1 est. | Yes | 0.015 |
| L40S 48GB | 48 | Q4 | 183.3 est. | Yes | 0.023 |
| Mac Studio M3 Ultra 96GB | 96 | Q4 | 173.7 est. | Yes | 0.043 |
| Mac Studio M2 Ultra 192GB | 192 | Q4 | 169.7 est. | Yes | 0.024 |
| RTX A6000 48GB | 48 | Q4 | 162.9 est. | Yes | 0.036 |
| RTX 5060 Ti 16GB | 16 | Q4 | 161.9 est. | No | 0.377 |
| RTX 5070 12GB | 12 | Q4 | 136.4 est. | No | 0.248 |
| Titan V 12GB | 12 | Q4 | 132.5 est. | No | 0.044 |
| Arc Pro B70 32GB | 32 | Q4 | 129.0 est. | Yes | 0.129 |
| A100 80GB SXM4 | 80 | FP16 | 118.9 est. | Yes | 0.008 |
| MacBook Pro M4 Max 128GB | 128 | Q4 | 115.8 est. | Yes | 0.026 |
| T4 16GB | 16 | Q4 | 115.6 est. | No | 0.058 |
| RTX 4070 Ti 12GB | 12 | Q4 | 112.5 est. | No | 0.141 |
| Titan Xp 12GB | 12 | Q4 | 111.3 est. | No | 0.093 |
| RTX 3080 10GB | 10 | Q4 | 107.1 est. | No | 0.153 |
| DGX Spark (GH200 480GB) | 480 | Q4 | 106.1 est. | Yes | 0.035 |
| RTX 4060 Ti 16GB | 16 | Q4 | 104.1 est. | No | 0.209 |
| RX 7600 XT 16GB | 16 | Q4 | 104.1 est. | No | 0.316 |
| RTX 4070 12GB | 12 | Q4 | 102.3 est. | No | 0.171 |
| RTX 4070 Super 12GB | 12 | Q4 | 102.3 est. | No | 0.171 |
| Titan X Pascal 12GB | 12 | Q4 | 97.5 est. | No | 0.081 |
| Arc B580 12GB | 12 | Q4 | 92.6 est. | No | 0.372 |
| RX 7700 XT 12GB | 12 | Q4 | 87.7 est. | No | 0.195 |
| MacBook Pro M1 Max 32GB | 32 | Q4 | 84.8 est. | Yes | 0.026 |
| MacBook Pro M1 Max 64GB | 64 | Q4 | 84.8 est. | Yes | 0.022 |
| MacBook Pro M3 Max 128GB | 128 | Q4 | 84.8 est. | Yes | 0.02 |
| RTX 3060 12GB | 12 | Q4 | 73.1 est. | No | 0.222 |
| RTX 6000 Ada 48GB | 48 | FP16 | 73.1 est. | No | 0.011 |
| L40S 48GB | 48 | FP16 | 65.7 est. | No | 0.008 |
| RTX 5090 32GB | 32 | FP16 | 60.6 est. | No | 0.03 |
| RTX A6000 48GB | 48 | FP16 | 58.4 est. | No | 0.013 |
| Mac mini M4 Pro 64GB | 64 | Q4 | 57.9 est. | Yes | 0.026 |
| MacBook Pro M1 Max 64GB | 64 | FP16 | 54.1 est. | No | 0.014 |
| Arc B570 10GB | 10 | Q4 | 53.5 est. | No | 0.244 |
| Mac Studio M3 Ultra 96GB | 96 | FP16 | 47.8 est. | Yes | 0.012 |
| Mac Studio M2 Ultra 192GB | 192 | FP16 | 46.7 est. | Yes | 0.007 |
| Ryzen AI Max+ 395 128GB | 96 | Q4 | 45.6 est. | Yes | 0.023 |
| Ryzen AI Max+ 395 64GB | 48 | Q4 | 45.6 est. | Yes | 0.03 |
| Ryzen AI Max 390 64GB | 48 | Q4 | 45.6 est. | Yes | 0.035 |
| RTX 5060 8GB | 8 | Q4 | 40.3 est. | No | 0.135 |
| RTX 5060 Ti 8GB | 8 | Q4 | 40.3 est. | No | 0.106 |
| RTX 3070 8GB | 8 | Q4 | 40.3 est. | No | 0.081 |
| Mac mini M4 Pro 64GB | 64 | FP16 | 36.9 est. | No | 0.017 |
| MacBook Pro M4 Max 128GB | 128 | FP16 | 31.8 est. | Yes | 0.007 |
| DGX Spark (GH200 480GB) | 480 | FP16 | 29.2 est. | Yes | 0.01 |
| RTX 4060 Ti 8GB | 8 | Q4 | 25.9 est. | No | 0.065 |
| RX 7600 8GB | 8 | Q4 | 25.9 est. | No | 0.096 |
| Mac mini M4 32GB | 32 | Q4 | 25.5 est. | Yes | 0.026 |
| RTX 4060 8GB | 8 | Q4 | 24.5 est. | No | 0.082 |
| MacBook Pro M3 Max 128GB | 128 | FP16 | 23.3 est. | Yes | 0.006 |
| Arc Pro B70 32GB | 32 | FP16 | 20.6 est. | No | 0.021 |
| RTX 4090 24GB | 24 | FP16 | 19.2 est. | No | 0.012 |
| RTX 4090D 24GB (China) | 24 | FP16 | 19.2 est. | No | 0.012 |
| RTX 3090 Ti 24GB | 24 | FP16 | 19.2 est. | No | 0.01 |
| RX 7900 XTX 24GB | 24 | FP16 | 18.2 est. | No | 0.018 |
| RTX 3090 24GB | 24 | FP16 | 17.8 est. | No | 0.012 |
| Tesla P4 8GB | 8 | Q4 | 17.3 est. | No | 0.216 |
| Ryzen AI Max+ 395 64GB | 48 | FP16 | 16.4 est. | No | 0.011 |
| Ryzen AI Max 390 64GB | 48 | FP16 | 16.4 est. | No | 0.013 |
| MacBook Pro M1 Max 32GB | 32 | FP16 | 13.5 est. | No | 0.004 |
| Ryzen AI Max+ 395 128GB | 96 | FP16 | 12.5 est. | Yes | 0.006 |
| RX 7900 XT 20GB | 20 | FP16 | 10.6 est. | No | 0.012 |
| Mac mini M4 32GB | 32 | FP16 | 4.1 est. | No | 0.004 |