中文

注意力机制中归一化的局限性

机器学习 2025-10-21 v2 人工智能 计算与语言

摘要

本文研究了注意力机制中归一化的局限性。我们从一个理论框架开始,该框架能够识别模型的选择能力以及token选择中涉及的几何分离。我们的分析包括在softmax缩放下token向量的距离和分离标准的明确界限。通过对预训练的GPT-2模型进行实验,我们在经验上验证了我们的理论结果,并分析了注意力机制的关键行为。值得注意的是,我们证明了随着所选token数量的增加,模型区分信息性token的能力下降,通常收敛于均匀选择模式。我们还表明,softmax归一化下的梯度敏感性在训练期间带来了挑战,特别是在低温设置下。这些发现推进了当前对基于softmax的注意力机制的理解,并促使未来注意力架构需要更鲁棒的归一化和选择策略。

关键词

引用

@article{arxiv.2508.17821,
  title  = {Limitations of Normalization in Attention Mechanism},
  author = {Timur Mudarisov and Mikhail Burtsev and Tatiana Petrova and Radu State},
  journal= {arXiv preprint arXiv:2508.17821},
  year   = {2025}
}

备注

10 pages, 4 figures