AI基础
Transformer架构
Transformer是大语言模型的统一架构基础。Self-Attention、位置编码、KV Cache、MoE等核心组件持续演进。
核心要点
- Self-Attention:每个token与所有token计算注意力,捕获任意距离依赖
- Multi-Head Attention:多头并行,关注不同子空间特征
- 位置编码:RoPE旋转位置编码,具备长度外推能力
- KV Cache:缓存已计算的K/V矩阵,生成推理加速关键
- MoE:混合专家,每个token只激活部分专家,计算高效
- Flash Attention:IO感知分块算法,Attention加速2-4x