中文

面向行人深度学习:Transformer 中的反向传播

机器学习 2025-12-30 v1

摘要

本文件是我们前一篇关于 CNN 反向传播向量化推导的后续工作。遵循相同原则与记号,本文聚焦于基于下一个标记预测的 Transformer 架构。为此,我们将轻量级无指数方法应用到新的层类型,如嵌入、多头注意力和层归一化。此外,我们还提供 LoRA 层的梯度表达式,以说明参数高效微调。为何要手动进行反向传播?当有众多工具可自动完成时,又为何要手动操作?对前向传播值传播理解的任何缺口,都会在尝试对损失函数进行求导时变得明显。通过手动进行反向传播,我们对每种操作如何影响最终输出获得更深入的直觉。也提供了一个最小化 GPT 类网络的完整 PyTorch 实现,以及其所有梯度更新的解析表达式。

关键词

引用

@article{arxiv.2512.23329,
  title  = {Deep learning for pedestrians: backpropagation in Transformers},
  author = {Laurent Boué},
  journal= {arXiv preprint arXiv:2512.23329},
  year   = {2025}
}