DAPE V2:将注意力得分作为特征图用于长度外推
计算与语言
2024-10-11 v3
摘要
注意力机制是 Transformer 模型的基本组件,贡献于不同记号之间的相互作用,这与早期的前馈神经网络不同。一般情况下,注意力得分仅由键-查询乘积简单决定。然而,本工作的偶然尝试(组合 DAPE 和 NoPE)在不使用位置编码的情况下对注意力得分包括额外 MLP,表明经典的键-查询乘法可能限制了 Transformer 的性能。在本工作中,我们将注意力概念化为特征图,并应用卷积算子(用于不同注意力头之间相邻注意力得分的处理)来模拟计算机视觉中的处理方法。本文的主要贡献在于识别并解释 Transformer 的长度外推问题是由于朴素查询和键点积的表达能力有限所致,并成功地将长度外推问题转化为众所周知的特征图处理问题。这种新颖见解可适用于各种与注意力相关的模型,揭示了当前 Transformer 架构可能的进一步演进潜力。广泛的实验表明,将注意力视为特征图并应用卷积作为处理方法可显著提升 Transformer 的性能。
关键词
引用
@article{arxiv.2410.04798,
title = {DAPE V2: Process Attention Score as Feature Map for Length Extrapolation},
author = {Chuanyang Zheng and Yihang Gao and Han Shi and Jing Xiong and Jiankai Sun and Jingyao Li and Minbin Huang and Xiaozhe Ren and Michael Ng and Xin Jiang and Zhenguo Li and Yu Li},
journal= {arXiv preprint arXiv:2410.04798},
year = {2024}
}
备注
Tech Report. Compared to DAPE, this work (DAPE V2) further analyzes the length extrapolation problem and translate the length extrapolation issue into a well-understood feature map processing problem. arXiv admin note: text overlap with arXiv:2405.14722