InfoFlow: 多层Transformer分析框架
机器学习
2026-05-19 v1
摘要
虽然近期研究对单层Transformer架构的逼近性能进行了探讨,但对多层设置的严格理论理解仍有限。本文确立了多层Transformer与单层Transformer在逼近能力上的根本差异:对于某些检索任务,任何单层Transformer都需要至少个参数才能实现精度,其中随序列长度 线性增长;而采用单头注意力的两层Transformer仅需最多个参数即可实现相同的逼近精度。为理解这一分离,我们识别了多层逼近背后的两种结构机制。具体而言,softmax注意力只能高效检索获得最大注意力得分的token,导致的第大检索在长度上的参数成本呈指数级增长。此外,解码耦合信息的参数成本随检索token集合的大小而扩展。针对上述发现,我们提出InfoFlow,一个用于多层Transformer的框架。该框架在每个token和层处跟踪可访问输入位置的信息集,为每种信息传播模式分配明确的逼近率。这一抽象恢复了已知的逼近界限,与实验观察一致,并在直接理论分析currently intractable的setting中提供具体预测。我们的结果为关于多层Transformer逼近效率的论证提供了原则框架。
引用
@article{arxiv.2605.17930,
title = {InfoFlow: A Framework for Multi-Layer Transformer Analysis},
author = {Penghao Yu and Haotian Jiang and Zeyu Bao and Qianxiao Li},
journal= {arXiv preprint arXiv:2605.17930},
year = {2026}
}
备注
36 pages