单层 Transformer 无法表示, 双层 Transformer 可以: 在任意阶马尔可夫链上证明表示归纳头的两层 Transformer
机器学习
2025-11-18 v2 人工智能
摘要
原子学习 (in-context learning, ICL) 是 Transformer 的一个标志性能力,通过该能力,训练好的模型能够通过利用输入上下文信息来适应新任务。先前的工作表明,ICL 由于存在称为归纳头 (induction heads) 的特殊电路而产生:给定归纳头与条件 k 元agram 之间的等价性,最近的一系列工作将序列输入建模为马尔可夫过程,揭示了模型深度对其 ICL 能力的根本影响:虽然两层 Transformer 能够有效地表示条件 1 元agram 模型,但其单层版本除非指数级放大,否则无法解决该任务。然而,对于更高阶的马尔可夫源,已知的最佳构造至少需要三层(每层一个注意力头)——这留下了一个开放问题:双层单注意力头 Transformer 是否能够表示任意第 k 阶马尔可夫过程?本文精确地回答了这个问题并理论地表明,双层 Transformer 每层一个注意力头即可确实表示任意条件 k 元agram。因此,我们的结果提供了 Transformer 深度与马尔可夫阶数进行 ICL 进行的刻紧已知表征。基于此,我们进一步分析了我们双层构造的学习动力学,关注简化的第一阶马尔可夫链的变体,说明在训练期间如何有效地出现原子表示。总之,这些结果加深了我们对基于 Transformer 的 ICL 理解,说明即使是浅层体系结构也能在结构化序列建模任务上出奇制胆地表现出强大的 ICL 能力。
关键词
引用
@article{arxiv.2508.07208,
title = {What One Cannot, Two Can: Two-Layer Transformers Provably Represent Induction Heads on Any-Order Markov Chains},
author = {Chanakya Ekbote and Marco Bondaschi and Nived Rajaraman and Jason D. Lee and Michael Gastpar and Ashok Vardhan Makkuva and Paul Pu Liang},
journal= {arXiv preprint arXiv:2508.07208},
year = {2025}
}
备注
Accepted at NeurIPS 2025