Transformer 中注意力的渐近行为
人工智能
2025-09-26 v2 机器学习
系统与控制
系统与控制
动力系统
最优化与控制
摘要
Transformer 架构已成为现代大型语言模型(LLM)的基础,但其理论属性仍不为人所了解。与经典神经网络类似,提高这些模型的常用方法是增加其规模和深度。然而,此类策略可能次优,因为已有研究表明,增加层数导致收益呈递增递减。更重要的是,先前的研究表明,增加深度可能导致模型崩溃,即所有 token 收敛到单个簇,从而损害 LLM 生成多样性输出的能力。基于 Transformer 动力学的微分方程模型,我们证明了在深度增加时,Transformer 中的所有 token 都会渐近收敛到单个簇。技术层面上,我们利用控制论工具,包括流形上的共识动力学和输入到状态稳定性(ISS)。随后,我们扩展了分析到自回归模型,利用其结构进一步泛化理论保证。
关键词
引用
@article{arxiv.2412.02682,
title = {The Asymptotic Behavior of Attention in Transformers},
author = {Álvaro Rodríguez Abella and João Pedro Silvestre and Paulo Tabuada},
journal= {arXiv preprint arXiv:2412.02682},
year = {2025}
}