AI基础
大模型训练
大模型训练涵盖预训练、SFT、RLHF三阶段。Scaling Law驱动模型规模持续增长,训练策略不断优化。
核心要点
- 预训练:海量文本数据、BPE/SentencePiece分词、Scaling Law
- SFT:监督微调,用人类标注的(prompt, response)对优化
- RLHF:训练奖励模型拟合人类偏好,PPO优化语言模型策略
- DPO:直接用偏好数据优化策略,绕过了奖励模型训练
- 分布式训练:数据并行、模型并行、流水线并行、ZeRO优化
AI基础
大模型训练涵盖预训练、SFT、RLHF三阶段。Scaling Law驱动模型规模持续增长,训练策略不断优化。