AI Hashrate · RTX 3090 24GB
RTX 3090 24GB 上该跑哪个大模型?
24 GB · 936 GB/s · 350 W
下面每个数字都来自本站向导背后的同一套引擎:按精度算显存占用、按显存带宽算解码速度、给出可直接启动的命令。没有任何内容是抓取或编造的。
一句话答案
gemma-4-26B-A4B-it — 预计 210.4 tok/s 解码
还放得下这些
| 模型 | Q4 显存占用 | 预计 tok/s |
|---|---|---|
| gpt-oss-20b | 13.2 GB | 222.1 |
| Qwen3.5-9B | 6.3 GB | 89.3 |
| Qwen3.6-35B-A3B | 21.3 GB | 266.5 |
| Ornith-1.0-9B | 6.3 GB | 88.8 |
| Qwen3-8B | 6.7 GB | 97.5 |
| gemma-4-12b-it | 8.2 GB | 66.9 |
| Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16 | 18.2 GB | 266.5 |
启动命令
llama-server \
-hf <GGUF_REPO>:Q4_K_M \
-c 8192 \
-ngl 99 \
--host 127.0.0.1 --port 8080
以上数字是根据硬件规格与公开实报建模的估算,不是在这张卡上跑出来的实测基准。向导页会展示每个数字的来源。