中文

DINT Transformer

计算与语言 2025-01-30 v1 人工智能 机器学习

摘要

DIFF Transformer 通过引入微分注意力机制解决了无关上下文干扰问题,增强了局部注意力的鲁棒性。然而,它存在两个关键局限:缺乏全局上下文建模,这对于识别全局重要 token 至关重要;以及由于注意力矩阵缺乏严格的行归一化导致的数值不稳定。为克服这些挑战,我们提出 DINT Transformer,通过计算全局重要性得分并将其整合到注意力矩阵中,扩展了 DIFF Transformer 的差分-积分机制。此外,统一的参数设计强制注意力矩阵进行行归一化,从而提高数值稳定性。实验结果表明,DINT Transformer 在各种实际应用中在准确性和鲁棒性方面表现优异,包括长上下文语言建模和关键信息检索等。这些结果将 DINT Transformer 定位为一种高度有效且前景广阔的架构。

关键词

引用

@article{arxiv.2501.17486,
  title  = {DINT Transformer},
  author = {Yueyang Cang and Yuhang Liu and Xiaoteng Zhang and Erlu Zhao and Li Shi},
  journal= {arXiv preprint arXiv:2501.17486},
  year   = {2025}
}

备注

arXiv admin note: text overlap with arXiv:2410.05258 by other authors