V100 16GB PCIe 的显存带宽高约 79%(900 对 504 GB/s)。batch-1 解码与带宽强相关,因此同能装下的模型在 V100 16GB PCIe 上解码约快 79%。 Q4/8K 下 V100 16GB PCIe 能装下的目录模型更多——73 个模型中 25 对 21(16 对 12 GB VRAM)。 能装进 V100 16GB PCIe 却装不进 RTX 4070 12GB 的最大模型:gemma-4-26B-A4B-it(25.2B)。 MSRP:RTX 4070 12GB 为 $599,V100 16GB PCIe 为 $8,000。MSRP 是发布标价而非实时售价——Amazon 价格会波动,点进去才是在售价格。 不可零售购买:V100 16GB PCIe(数据中心级;现实使用方式是云租赁)。 下方 Q4/8K 正面对比(46 个共有模型)中,V100 16GB PCIe 在 46 行 tok/s 更高,0 行落后。 方法论.
| RTX 4070 12GB | V100 16GB PCIe | |
|---|---|---|
| 厂商 | NVIDIA | NVIDIA |
| VRAM | 12 GB | 16 GB |
| 显存类型 | GDDR6X | HBM2 |
| 显存带宽 | 504 GB/s | 900 GB/s |
| TDP | 200 W | 250 W |
| MSRP(标价) | $599 | $8,000 |
| 购买 | ASUS Dual GeForce RTX 4070 OC 12GB · 更多商品 · eBay · Newegg · B&H Photo | — |
| 模型 | 参数 (B) | RTX 4070 12GB tok/s | RTX 4070 12GB 装得下 | V100 16GB PCIe tok/s | V100 16GB PCIe 装得下 | 胜者 |
|---|---|---|---|---|---|---|
| MiniCPM5-1B | 1.08 | 494.6 估算 | 是 | 895.6 估算 | 是 | V100 16GB PCIe |
| Qwen3.5-2B | 2.0 | 267.1 估算 | 是 | 483.6 估算 | 是 | V100 16GB PCIe |
| Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16 | 30.0 | 136.6 估算 | 否 | 434.0 估算 | 否 | V100 16GB PCIe |
| DeepSeek-R1-0528-Qwen3-8B-layer-mix-bpw-3.8-mlx | 2.3 | 232.2 估算 | 是 | 420.5 估算 | 是 | V100 16GB PCIe |
| Qwen3-30B-A3B-Instruct-2507 | 30.5 | 127.6 估算 | 否 | 405.4 估算 | 否 | V100 16GB PCIe |
| Qwen3.5-35B-A3B | 34.7 | 106.9 估算 | 否 | 339.8 估算 | 否 | V100 16GB PCIe |
| Ornith-1.0-35B | 35.0 | 105.2 估算 | 否 | 334.2 估算 | 否 | V100 16GB PCIe |
| qwen35b-a3b-fable-sft-abliterated | 34.7 | 102.3 估算 | 否 | 325.2 估算 | 否 | V100 16GB PCIe |
| Qwen3.6-35B-A3B | 36.0 | 99.7 估算 | 否 | 316.9 估算 | 否 | V100 16GB PCIe |
| GLM-4.7-Flash | 31.2 | 98.5 估算 | 否 | 313.0 估算 | 否 | V100 16GB PCIe |
| Llama-3.2-3B-Instruct | 3.2 | 160.7 实测 | 是 | 302.3 估算 | 是 | V100 16GB PCIe |
| gpt-oss-20b | 21.5 | 215.7 估算 | 否 | 268.7 估算 | 是 | V100 16GB PCIe |
| gemma-4-26B-A4B-it | 25.2 | 150.3 估算 | 否 | 254.5 估算 | 是 | V100 16GB PCIe |
| Qwen3-4B-Instruct-2507 | 4.0 | 133.5 估算 | 是 | 241.8 估算 | 是 | V100 16GB PCIe |
| NVIDIA-Nemotron-3-Nano-4B-BF16 | 4.0 | 133.5 估算 | 是 | 241.8 估算 | 是 | V100 16GB PCIe |
| RTX 4070 12GB | V100 16GB PCIe | |
|---|---|---|
| 装得下的目录模型 | 73 个中 21 个 | 73 个中 25 个 |
| 独占装下的最大模型 | — | gemma-4-26B-A4B-it (25.2B) |