硬件概览

机房 30 台 RTX 4060(8GB 显存),千兆交换机互联。

核心矛盾

消费级 GPU 没有 NVLink,单卡 8GB 显存跑不动 7B 以上模型。需要在显存-带宽双重约束下找到最优解。

技术路线

量化策略

  • Q4_K_M 是主流精度/速度平衡点
  • IQ3_XXS 在 3-bit 级别精度最高
  • 目标:7B 模型在 8GB 显存中跑 8K 上下文

分布式推理

  • llama.cpp RPC 后端支持层切分
  • Decode 阶段跨机通信量仅 8KB/token
  • 3-4 台 4060 可运行 27B Q4 模型

FPGA 加速

  • Zynq 7020 做激活压缩中间件
  • delta 编码 + 4-bit 量化
  • 传输量可压缩到 1/5-1/10

参考

详见 /course/集群方案/