中文

Transformer 的丰富性:近似与动力学分析

机器学习 2025-01-30 v3 最优化与控制 机器学习

摘要

Transformer 在原子学习能力方面表现出色,但其背后机制的理论理解仍有限。近期工作 (Elhage 等, 2021) 识别了一种称为 induction head 的“丰富”内在机制,与忽略长程依赖的“懒惰” n-gram 模型形成对比。在本工作中,我们对 Transformer 实现 induction head 的近似与动力学进行了分析。在**近似**分析中,我们形式化了标准和广义 induction head 机制,并检查了 Transformer 如何有效实现这些机制,重点强调每个 Transformer 子模块的独特作用。在**动力学**分析中,我们研究了在由 4-gram 和原子 2-gram 组成的合成混合目标上的训练动力学。这一受控设置允许我们精确描述整个训练过程,并揭示了从懒惰 (4-gram) 到丰富 (induction head) 机制之间的**突变**。

关键词

引用

@article{arxiv.2410.11474,
  title  = {How Transformers Get Rich: Approximation and Dynamics Analysis},
  author = {Mingze Wang and Ruoxi Yu and Weinan E and Lei Wu},
  journal= {arXiv preprint arXiv:2410.11474},
  year   = {2025}
}

备注

47 pages