中文

多层 Transformer 中堆叠注意力头的机制与涌现

机器学习 2025-10-29 v4 计算与语言

摘要

在本文中,我引入了检索问题,这是一个简单却常见的推理任务,只能由层数随输入规模对数增长的最小层数的 transformer 解决。我通过实验表明,大型语言模型无需任何微调即可在不同提示表述下解决该任务。为了理解 transformer 如何解决检索问题,我在最小表述上训练了几个 transformer。成功的学习仅在存在隐式课程时发生。我通过研究训练后的 transformer 中的注意力图揭示了所学到的机制。我还研究了训练过程,发现注意力头始终在隐式课程的引导下以特定顺序涌现。

关键词

引用

@article{arxiv.2411.12118,
  title  = {Mechanism and Emergence of Stacked Attention Heads in Multi-Layer Transformers},
  author = {Tiberiu Musat},
  journal= {arXiv preprint arXiv:2411.12118},
  year   = {2025}
}