APPLE SILICON 指南
Apple Silicon 统一内存运行本地大模型
Apple Silicon 没有传统独立显存的概念:CPU 和 GPU 共享内存池。真正有用的输入是机器分配的内存,以及 GPU 可用的带宽。
统一内存改变了问题
操作系统、CPU 和 GPU 共用一个内存池。不要把标称容量全部当作模型可用空间,应为 macOS 和其他应用留出余量。
容量和带宽是两件事
更大的统一内存可以容纳更大的模型,但带宽仍会影响 decode 速度。目录同时展示两个数值,避免混淆。
结合工作负载测试后端
目录中的硬件后端是 Metal,MLX 是支持的运行时命令路径之一。修改 context 或量化后,应重新检查是否放得下。
目录中的 Apple Silicon 机器
| 机器 | 统一内存 | 带宽 | 后端 |
|---|---|---|---|
| MacBook Neo A18 Pro 8GB | 8 GB | 60 GB/s | metal |
| MacBook Pro M1 Max 32GB | 32 GB | 400 GB/s | metal |
| Mac mini M4 32GB | 32 GB | 120 GB/s | metal |
| MacBook Pro M1 Max 64GB | 64 GB | 400 GB/s | metal |
| Mac mini M4 Pro 64GB | 64 GB | 273 GB/s | metal |
| Mac Studio M3 Ultra 96GB | 96 GB | 819 GB/s | metal |
| MacBook Pro M4 Max 128GB | 128 GB | 546 GB/s | metal |
| Mac Studio M2 Ultra 192GB | 192 GB | 800 GB/s | metal |
显存与带宽是目录输入。实际可用内存和速度会受系统分配、后端、温度和工作负载影响。
准备测试你的机器了吗?
输入 GPU 或可用显存,计算器会根据工作负载、量化和 context 对模型排序。
打开计算器