训练诱导的Transformer代数模型中的Token聚类逃逸
机器学习
2026-05-11 v1 偏微分方程分析
动力系统
最优化与控制
摘要
Transformer通过跨层迭代转换token表示执行推理。这种层级计算已被经验性地研究,最近的Transformer动力学均场理论解释了注意力如何驱动token分布趋向聚类。然而,现有的均场分析大体将模型参数视为给定的,留下了训练如何重塑这一聚类图景的开放问题。我们在一个带噪声的均场Transformer中研究此问题,其中仅训练参数线性FFN,采用正则化。我们发现并分析了一种训练诱导的动力学相位:在初始遵循注意力驱动的聚类之后,token分布可在最终层附近离开聚类 regime。我们的数学分析基于一种包容注意力聚类偏置的熵正则化相互作用能量。更广泛地说,我们的结果指向一种将训练和推理动力学一起处理的训练感知均场Transformer动力学理论。
引用
@article{arxiv.2605.07772,
title = {Training-Induced Escape from Token Clustering in a Mean-Field Formulation of Transformers},
author = {Noboru Isobe and Daisuke Inoue and Masaaki Imaizumi},
journal= {arXiv preprint arXiv:2605.07772},
year = {2026}
}
备注
48 pages, 6 figures, comments are wellcome!