DINT Transformer
计算与语言
2025-01-30 v1 人工智能
机器学习
摘要
DIFF Transformer 通过引入微分注意力机制解决了无关上下文干扰问题,增强了局部注意力的鲁棒性。然而,它存在两个关键局限:缺乏全局上下文建模,这对于识别全局重要 token 至关重要;以及由于注意力矩阵缺乏严格的行归一化导致的数值不稳定。为克服这些挑战,我们提出 DINT Transformer,通过计算全局重要性得分并将其整合到注意力矩阵中,扩展了 DIFF Transformer 的差分-积分机制。此外,统一的参数设计强制注意力矩阵进行行归一化,从而提高数值稳定性。实验结果表明,DINT Transformer 在各种实际应用中在准确性和鲁棒性方面表现优异,包括长上下文语言建模和关键信息检索等。这些结果将 DINT Transformer 定位为一种高度有效且前景广阔的架构。
引用
@article{arxiv.2501.17486,
title = {DINT Transformer},
author = {Yueyang Cang and Yuhang Liu and Xiaoteng Zhang and Erlu Zhao and Li Shi},
journal= {arXiv preprint arXiv:2501.17486},
year = {2025}
}
备注
arXiv admin note: text overlap with arXiv:2410.05258 by other authors