课程目录

AI基础

Transformer架构

Transformer是大语言模型的统一架构基础。Self-Attention、位置编码、KV Cache、MoE等核心组件持续演进。

核心要点

  • Self-Attention:每个token与所有token计算注意力,捕获任意距离依赖
  • Multi-Head Attention:多头并行,关注不同子空间特征
  • 位置编码:RoPE旋转位置编码,具备长度外推能力
  • KV Cache:缓存已计算的K/V矩阵,生成推理加速关键
  • MoE:混合专家,每个token只激活部分专家,计算高效
  • Flash Attention:IO感知分块算法,Attention加速2-4x

关联知识