信息熵不变性:增强注意力机制中的长度外推能力
计算与语言
2025-01-28 v3
摘要
自 2021 年关注如何提高大型语言模型长度外推能力的研究出现以来,一些研究在其提出的方法中未提供严格的理论依据,便对缩放点积注意力机制中的缩放因子进行了修改。为填补这一空白,我们提出了两种基于信息熵不变性的新型缩放温度,以增强长度外推能力。首先,为点积注意力设计了一个训练自由的 InfoScale 方法,通过确保熵值一致来保持对原始 token 的关注。其次,我们对缩放(CosScale)对余弦注意力的影响进行了理论分析。实验数据表明,结合 InfoScale 和 CosScale 可在 GAU-α 模型上实现最佳性能,上下文窗口可扩展至训练长度的 64 倍,并优于七种现有方法。我们的分析表明,显著增加 CosScale 近似于窗口化注意力,凸显了注意力得分稀释在处理长程上下文中的关键挑战。代码与数据已公开于 https://github.com/HT-NEKO/Information-Entropy-Invariance。
引用
@article{arxiv.2501.08570,
title = {Information Entropy Invariance: Enhancing Length Extrapolation in Attention Mechanisms},
author = {Kewei Li and Yanwen Kong and Yiping Xu and Jianlin Su and Lan Huang and Ruochi Zhang and Fengfeng Zhou},
journal= {arXiv preprint arXiv:2501.08570},
year = {2025}
}