课程目录

AI基础

大模型训练

大模型训练涵盖预训练、SFT、RLHF三阶段。Scaling Law驱动模型规模持续增长,训练策略不断优化。

核心要点

  • 预训练:海量文本数据、BPE/SentencePiece分词、Scaling Law
  • SFT:监督微调,用人类标注的(prompt, response)对优化
  • RLHF:训练奖励模型拟合人类偏好,PPO优化语言模型策略
  • DPO:直接用偏好数据优化策略,绕过了奖励模型训练
  • 分布式训练:数据并行、模型并行、流水线并行、ZeRO优化

关联知识