AI21-Jamba-Large-1.5(ai21labs)是 AI Hashrate 收录的398.6B 参数开放权重模型。 按 8K 上下文估算:Q4 约需 299.95 GB VRAM(权重 219.23 GB + KV 79.72 GB + 开销 1 GB),FP16 约需 877.92 GB。 在该上下文假设下,目录中约有 1 款 GPU/加速器能在 Q4 下完整装下此模型。 Q4 最快配置:DGX Spark (GH200 480GB) ≈ 0.8 tok/s(估算)。 下表给出各硬件的 VRAM 装机情况与每美元 tok/s(按 MSRP 标价)。估算基于显存带宽公式;有实测时以实测为准。详见方法论页。 方法论.
| 硬件 | VRAM | 量化 | tok/s | 装得下? | tok/s/$ |
|---|---|---|---|---|---|
| B200 192GB SXM | 192 | Q4 | 14.9 估算 | 否 | 0.0 |
| MI300X 192GB | 192 | Q4 | 9.9 估算 | 否 | 0.001 |
| H200 141GB SXM5 | 141 | Q4 | 4.8 估算 | 否 | 0.0 |
| Gaudi 3 128GB | 128 | Q4 | 2.7 估算 | 否 | 0.0 |
| Mac Studio M2 Ultra 192GB | 192 | Q4 | 1.5 估算 | 否 | 0.0 |
| H100 80GB SXM5 | 80 | Q4 | 1.1 估算 | 否 | 0.0 |
| DGX Spark (GH200 480GB) | 480 | Q4 | 0.8 估算 | 是 | 0.0 |
| A100 80GB SXM4 | 80 | Q4 | 0.7 估算 | 否 | 0.0 |
| MacBook Pro M4 Max 128GB | 128 | Q4 | 0.5 估算 | 否 | 0.0 |
| Mac Studio M3 Ultra 96GB | 96 | Q4 | 0.4 估算 | 否 | 0.0 |
| MacBook Pro M3 Max 128GB | 128 | Q4 | 0.3 估算 | 否 | 0.0 |
| DGX Spark (GH200 480GB) | 480 | FP16 | 0.2 估算 | 否 | 0.0 |
| Ryzen AI Max+ 395 128GB | 96 | Q4 | 0.1 估算 | 否 | 0.0 |