中文

自注意力中Token的动力学特性及位置编码的影响

机器学习 2025-12-04 v1

摘要

本文研究了预训练Transformer模型中Token的动力学特性,并探索其用于改进Transformer的方法。为此,我们分析了支配预训练模型连续时间极限的动力学系统,并刻画了其解的渐近行为。具体而言,我们刻画了Token随时间相互靠近或远离的条件,取决于模型参数。我们基于这些参数提供了充分条件,以识别Token收敛至零或发散至无穷的场景。与先前工作不同,我们的条件范围更广且更适用于实际模型。此外,我们研究了不同形式的位置编码——具体而言绝对位置编码和旋转位置编码——如何影响这些动力学区域。经验证据表明收敛场景对模型性能产生不利影响。受这些洞察启发,我们提出了Transformer架构的简单改进,以缓解具有绝对或旋转位置编码的模型中的收敛行为。这些发现为改进Transformer模型的理论基础和设计原则提供了支撑。

关键词

引用

@article{arxiv.2512.03058,
  title  = {Dynamical Properties of Tokens in Self-Attention and Effects of Positional Encoding},
  author = {Duy-Tung Pham and An The Nguyen and Viet-Hoang Tran and Nhan-Phu Chung and Xin T. Tong and Tan M. Nguyen and Thieu N. Vo},
  journal= {arXiv preprint arXiv:2512.03058},
  year   = {2025}
}