自注意力的特征分析及其基于部分计算的重构
机器学习
2021-06-17 v1
摘要
最先进的transformer模型采用基于成对点积的自注意力机制,其计算代价随输入序列长度呈二次方增长。本文中,我们考察在典型输入分布下通过该点积机制计算得到的注意力分数的全局结构,并研究其变化的主成分。通过对完整注意力分数矩阵及其各行进行特征分析,我们发现注意力分数间的大部分变化位于低维特征空间内。此外,我们发现不同层乃至不同transformer模型的这些特征空间之间存在显著重叠。基于此,我们提出仅对令牌对的部分子集计算分数,并用以估计其余对的分数。除考察注意力分数本身重构的精度外,我们研究了采用这些近似的transformer模型训练,并分析了其对总体精度的影响。我们的分析与所提方法为如何权衡精确成对注意力及其显著计算开销提供了见解。
引用
@article{arxiv.2106.08823,
title = {Eigen Analysis of Self-Attention and its Reconstruction from Partial Computation},
author = {Srinadh Bhojanapalli and Ayan Chakrabarti and Himanshu Jain and Sanjiv Kumar and Michal Lukasik and Andreas Veit},
journal= {arXiv preprint arXiv:2106.08823},
year = {2021}
}
备注
14 pages