本地AI大模型硬件推荐指南
核心原则:显存/内存决定你能跑多大的模型
本地跑大模型,第一瓶颈永远是显存(GPU)或统一内存(Apple),其次才是算力。量化是放大可用模型尺寸的杠杆。
各档位模型所需最低显存(Q4_K_M量化)
| 模型参数量 | 最低显存 | 推荐显存 | 代表模型 |
|---|---|---|---|
| 1B-3B | 4 GB | 6 GB | Qwen3-1.7B, Phi-4-mini |
| 7B-8B | 6 GB | 8 GB | Qwen3-8B, Llama-3.2-3B(轻松上13B) |
| 13B-14B | 10 GB | 12 GB | Qwen3-14B, Gemma-3-12B |
| 30B-35B | 20 GB | 24 GB | Qwen3-30B, Llama-3.1-70B(Q3) |
| 70B+ | 40 GB | 48-80 GB | Llama-3.1-70B(Q4), Qwen3-32B/480B |
🟢 入门级:¥1,500 - ¥3,000(二手/降级卡方案)
目标:跑 7B-14B 模型,体验对话
| 配置 | 价格 | 说明 |
|---|---|---|
| RTX 3060 12G(二手) | ¥1,000-1,200 | 性价比之王,12G显存能跑7B-Q4 + 14B-Q3 |
| RTX 4060 Ti 16G(全新) | ¥3,200-3,500 | 16G显存可跑14B-Q4或30B-Q3 |
| 主板+CPU+16G内存 | ¥800-1,200 | i3-12100 / R5-5600 级别 |
| 合计 | ¥1,800-2,500 |
能跑什么:
- RTX 3060 12G → Qwen3-8B (Q4, ~5.5GB) 流畅,Qwen3-14B (Q3, ~8GB) 勉强
- RTX 4060 Ti 16G → Qwen3-14B (Q4, ~9GB) 舒适,Qwen3-30B (Q3, ~14GB) 可用
适合人群: 学生、尝鲜用户、需要本地推理做开发调试
🟡 进阶级:¥5,000 - ¥8,000(主力甜点)
目标:跑 14B-35B 模型,日常生产力
| 配置 | 价格 | 说明 |
|---|---|---|
| RTX 4070 Ti Super 16G | ¥5,200-5,800 | 16G显存,PCIe 4.0 x16 |
| RTX 4080 Super 16G | ¥6,500-7,200 | 同样16G但算力强30% |
| RTX 5070 Ti 16G(新品) | ¥5,500-6,000 | Blackwell架构,能效更好 |
| 主板+CPU+32G内存 | ¥2,000-2,500 | i5-14600K / R7-7700X |
| 合计 | ¥7,000-9,000 |
💡 Apple替代方案:
| 配置 | 价格 | 说明 |
|---|---|---|
| MacBook Pro M4 Pro 48GB | ¥16,999 | 48GB统一内存,跑30B-Q4非常舒服 |
| Mac Studio M2 Ultra 64GB(二手) | ¥12,000-14,000 | 64GB统一内存,70B-Q4可跑 |
能跑什么:
- RTX 4070 Ti Super 16G → Qwen3-14B (Q4) 飞快,Qwen3-30B (Q3) 可用
- MacBook M4 Pro 48GB → Qwen3-32B (Q4, ~22GB),Llama-3.1-70B (Q3, ~36GB) 舒适
🟠 进阶级:¥10,000 - ¥15,000
目标:跑 30B-70B 模型,高质量推理
| 配置 | 价格 | 说明 |
|---|---|---|
| RTX 4090 24G | ¥13,000-15,000 | 消费级旗舰,24G显存 |
| 双 RTX 3090 24G×2(二手) | ¥8,000-10,000 | 48G总显存,多卡并行 |
| 主板+CPU+64G内存 | ¥3,000-4,000 | 需支持双卡,X670E / Z790 |
| 合计 | ¥11,000-19,000 |
💡 Apple替代方案:
| 配置 | 价格 | 说明 |
|---|---|---|
| MacBook Pro M4 Max 128GB | ¥26,999 | 128GB统一内存,70B-Q4+长上下文丝滑 |
能跑什么:
- RTX 4090 24G → Llama-3.1-70B (Q4, ~38GB) 需量化到Q3/Q2,或70B(Q4)+部分层CPU offload
- 双RTX 3090 48G → Llama-3.1-70B (Q4, ~38GB) 刚好放下,vLLM tensor parallel
- M4 Max 128GB → 70B(Q4) + 超长上下文,或350B小量化版
🔴 专业级:¥20,000 - ¥50,000+
目标:70B+全精度、微调、多模型并发
| 配置 | 价格 | 说明 |
|---|---|---|
| RTX 6000 Ada 48G | ¥40,000-50,000 | 专业卡, ECC,稳定运行 |
| 双 RTX 4090 24G×2 | ¥26,000-30,000 | 48G总显存,vLLM tensor parallel |
| A100 80G(租赁/二手) | ¥3,000-5,000/月 | 租赁方案更划算 |
| 工作站平台 | ¥5,000-8,000 | Threadripper / Xeon,PCIe通道充足 |
| 合计 | ¥30,000-60,000 |
💡 Apple终极方案:
| 配置 | 价格 | 说明 |
|---|---|---|
| Mac Studio M2 Ultra 192GB | ¥35,000-40,000(二手) | 192GB统一内存,350B Q4可跑 |
能跑什么:
- 双RTX 4090 48G → Llama-3.1-70B (Q4, ~40GB) 完整放入,vLLM 双卡tensor parallel
- RTX 6000 Ada 48G → 同上,但更稳定
- M2 Ultra 192GB → Qwen3-480B (Q3) 小量化版,或70B + 极长上下文
💎 企业级:¥100,000+
目标:千亿参数模型、批量微调、高并发服务
| 配置 | 价格 | 说明 |
|---|---|---|
| 8× RTX 4090 服务器 | ¥120,000-150,000 | 192G总显存,FPGA互联 |
| 8× H100 80G | ¥800,000+ | 数据中心级,NVLink互联 |
| 4× A100 80G | ¥400,000-600,000 | 二手/租赁 |
能跑什么:
- 8×4090 → 所有开源模型全精度运行,可微调70B
- H100 ×8 → 千亿参数模型微调,生产级并发服务
关键选购建议
1. NVIDIA vs Apple Silicon
| 维度 | NVIDIA GPU | Apple Silicon |
|---|---|---|
| 生态 | vLLM、TensorRT-LLM 完美支持 | llama.cpp Metal 优化极好 |
| 推理速度 | 同价位快2-5x | 慢但功耗极低 |
| 显存/内存 | 受限于单卡/多卡 | 统一内存可突破24G限制 |
| 微调 | 唯一选择 | 仅限QLoRA等小模型微调 |
| 静音/功耗 | 高噪音、高功耗 | 几乎无声、低功耗 |
| 最佳场景 | 追求速度、需要微调 | 追求大模型尺寸、安静环境 |
2. 量化选择对显存的影响
| 量化格式 | 70B模型 | 32B模型 | 质量损失 |
|---|---|---|---|
| FP16 | ~140 GB | ~64 GB | 无 |
| Q8_0 | ~72 GB | ~34 GB | 极小 |
| Q6_K | ~56 GB | ~26 GB | 小 |
| Q4_K_M | ~40 GB | ~19 GB | 可接受 |
| Q5_K_M | ~48 GB | ~23 GB | 很小 |
| Q3_K_M | ~30 GB | ~14 GB | 中等 |
| Q2_K | ~22 GB | ~11 GB | 明显 |
3. 避坑指南
- 不要买 RTX 3060 8G 版本,只买12G版本
- RTX 4060 Ti 8G 别碰,16G版才有意义
- 多卡注意PCIe通道数,消费级CPU通常只支持20条PCIe Lane,双卡要x8+x8
- Apple M系列芯片,内存带宽是关键:Max/Ultra 比 Pro 快很多(300 vs 400+ GB/s)
- CPU推理(无GPU):需要大内存(64G+),速度慢但可用,适合应急
- Intel Arc GPU 正在改善,但目前生态仍弱于NVIDIA
4. 如果预算有限
| 方案 | 价格 | 效果 |
|---|---|---|
| 纯CPU + 64G DDR4 | ¥1,500 | 7B模型可用,速度慢但能跑 |
| 云GPU租赁 | ¥2-5/小时 | A100 40G按需使用,适合偶尔跑大模型 |
| 二手RTX 3090 24G | ¥5,000-6,000 | 双卡¥10K = 48G,性价比最高的大模型方案 |
总结:按需求选
| 你的需求 | 推荐配置 | 预算 |
|---|---|---|
| 学AI、跑7B玩一玩 | RTX 3060 12G(二手) | ¥1,200 |
| 日常开发、14B模型 | RTX 4060 Ti 16G 或 4070 Ti Super | ¥5,000 |
| 跑30B模型、追求大尺寸 | MacBook M4 Pro 48GB | ¥17,000 |
| 跑70B模型 | 双RTX 3090 24G 或 RTX 4090 24G | ¥10,000-15,000 |
| 70B全精度+微调 | RTX 6000 Ada 48G 或 双4090 | ¥30,000+ |
| 极致大模型(不追求速度) | Mac Studio M2 Ultra 192GB | ¥35,000 |