课程目录

大模型工程

大模型精度与量化

把模型权重、激活、累加器、敏感算子和 KV Cache 分开看,理解 FP32/FP16/BF16/FP8/INT8/INT4 与 W8A8、W8A16、W4A16 的真实含义。

核心要点

  • FP16 与 BF16 同为16位:FP16尾数较长,BF16指数范围更接近FP32
  • FP8 与 INT8 都占8位但编码不同;8位不是一个统一的精度等级
  • W8A8=权重8位+激活8位,W8A16/W4A16是常见weight-only配置
  • 权重、激活、累加、LayerNorm/Softmax和KV Cache可以分别选择精度
  • PTQ成本低;QAT在训练中模拟量化误差,适合更激进的低位方案
  • 校准集、scale/zero point、per-tensor/per-channel粒度和离群值决定量化误差
  • 选型必须同时实测任务质量、显存、TTFT、TPOT/吞吐和并发稳定性

关联知识