课程目录

大模型工程

注意力变体

通过 KV 共享、低秩压缩或稀疏连接降低注意力缓存与计算成本。

核心要点

  • MQA/GQA 改变 KV 共享粒度
  • MLA 用潜变量压缩信息
  • 稀疏连接会改变信息可达路径