多层 Transformer 中堆叠注意力头的机制与涌现
机器学习
2025-10-29 v4 计算与语言
摘要
在本文中,我引入了检索问题,这是一个简单却常见的推理任务,只能由层数随输入规模对数增长的最小层数的 transformer 解决。我通过实验表明,大型语言模型无需任何微调即可在不同提示表述下解决该任务。为了理解 transformer 如何解决检索问题,我在最小表述上训练了几个 transformer。成功的学习仅在存在隐式课程时发生。我通过研究训练后的 transformer 中的注意力图揭示了所学到的机制。我还研究了训练过程,发现注意力头始终在隐式课程的引导下以特定顺序涌现。
引用
@article{arxiv.2411.12118,
title = {Mechanism and Emergence of Stacked Attention Heads in Multi-Layer Transformers},
author = {Tiberiu Musat},
journal= {arXiv preprint arXiv:2411.12118},
year = {2025}
}