中文

InfoFlow: 多层Transformer分析框架

机器学习 2026-05-19 v1

摘要

虽然近期研究对单层Transformer架构的逼近性能进行了探讨,但对多层设置的严格理论理解仍有限。本文确立了多层Transformer与单层Transformer在逼近能力上的根本差异:对于某些检索任务,任何单层Transformer都需要至少Ω(εk)\Omega (\varepsilon^{-k})个参数才能实现精度ε\varepsilon,其中k k 随序列长度 TT 线性增长;而采用单头注意力的两层Transformer仅需最多O(ε1) O (\varepsilon^{-1})个参数即可实现相同的逼近精度。为理解这一分离,我们识别了多层逼近背后的两种结构机制。具体而言,softmax注意力只能高效检索获得最大注意力得分的token,导致k2k \geq 2的第kk大检索在长度上的参数成本呈指数级增长。此外,解码耦合信息的参数成本随检索token集合的大小而扩展。针对上述发现,我们提出InfoFlow,一个用于多层Transformer的框架。该框架在每个token和层处跟踪可访问输入位置的信息集,为每种信息传播模式分配明确的逼近率。这一抽象恢复了已知的逼近界限,与实验观察一致,并在直接理论分析currently intractable的setting中提供具体预测。我们的结果为关于多层Transformer逼近效率的论证提供了原则框架。

关键词

引用

@article{arxiv.2605.17930,
  title  = {InfoFlow: A Framework for Multi-Layer Transformer Analysis},
  author = {Penghao Yu and Haotian Jiang and Zeyu Bao and Qianxiao Li},
  journal= {arXiv preprint arXiv:2605.17930},
  year   = {2026}
}

备注

36 pages