硬件概览
机房 30 台 RTX 4060(8GB 显存),千兆交换机互联。
核心矛盾
消费级 GPU 没有 NVLink,单卡 8GB 显存跑不动 7B 以上模型。需要在显存-带宽双重约束下找到最优解。
技术路线
量化策略
- Q4_K_M 是主流精度/速度平衡点
- IQ3_XXS 在 3-bit 级别精度最高
- 目标:7B 模型在 8GB 显存中跑 8K 上下文
分布式推理
- llama.cpp RPC 后端支持层切分
- Decode 阶段跨机通信量仅 8KB/token
- 3-4 台 4060 可运行 27B Q4 模型
FPGA 加速
- Zynq 7020 做激活压缩中间件
- delta 编码 + 4-bit 量化
- 传输量可压缩到 1/5-1/10
参考
详见 /course/集群方案/