中文

Attention 与 Markov:基于马尔可夫链的 Transformer 原理化分析框架

机器学习 2025-07-22 v2 计算与语言 信息论 math.IT 机器学习

摘要

基于注意力机制的 Transformer 在包括自然语言在内的多个领域取得了巨大成功。为了加深对其序列建模能力的理解,越来越多的人对使用马尔可夫输入过程来研究它们产生了兴趣。一个关键发现是,当在一阶马尔可夫链上训练时,两层或更多层的 Transformer 会一致地发展出归纳头机制,以估计上下文二元条件分布。相比之下,单层 Transformer 无法形成归纳头,只能直接学习马尔可夫核,但常常面临一个令人惊讶的挑战:它们会陷入表示一元分布的局部极小值,而更深的模型则能可靠地收敛到真实的二元分布。虽然单层 Transformer 在理论上可以对一阶马尔可夫链进行建模,但它们在实践中无法学习这一简单核的经验性失败仍是一个令人好奇的现象。为了解释单层模型的这种对比行为,本文引入了一个基于马尔可夫链对 Transformer 进行原理化分析的新框架。利用该框架,我们在理论上刻画了单层 Transformer 的损失景观,并证明了全局极小值(二元)和不良局部极小值(一元)的存在取决于数据属性和模型架构。我们精确描绘了这些局部最优解出现的区域。实验表明,我们的理论发现与经验结果相一致。最后,我们概述了该领域内的几个开放问题。代码可在 https://github.com/Bond1995/Markov 获取。

关键词

引用

@article{arxiv.2402.04161,
  title  = {Attention with Markov: A Framework for Principled Analysis of Transformers via Markov Chains},
  author = {Ashok Vardhan Makkuva and Marco Bondaschi and Adway Girish and Alliot Nagle and Martin Jaggi and Hyeji Kim and Michael Gastpar},
  journal= {arXiv preprint arXiv:2402.04161},
  year   = {2025}
}

备注

Published at ICLR 2025 under the title "Attention with Markov: A Curious Case of Single-Layer Transformers"