Qwen3.6-35B-A3B-FP8(Qwen)是 AI Hashrate 收录的36.0B 参数 MoE(每 token 激活 36.0B)开放权重模型。 按 8K 上下文估算:Q4 约需 28.0 GB VRAM(权重 19.8 GB + KV 7.2 GB + 开销 1 GB),FP16 约需 80.2 GB。 在该上下文假设下,目录中约有 24 款 GPU/加速器能在 Q4 下完整装下此模型。 Q4 最快配置:B200 192GB SXM ≈ 141.4 tok/s(估算); MI300X 192GB ≈ 93.7 tok/s(估算); H200 141GB SXM5 ≈ 84.8 tok/s(估算); H100 80GB SXM5 ≈ 59.2 tok/s(估算); Gaudi 3 128GB ≈ 57.9 tok/s(估算)。 下表给出各硬件的 VRAM 装机情况与每美元 tok/s(按 MSRP 标价)。估算基于显存带宽公式;有实测时以实测为准。详见方法论页。 方法论.