草图技术作为理解与加速长序列自注意力的工具
机器学习
2021-12-13 v1 计算与语言
机器学习
摘要
基于 Transformer 的模型由于自注意力模块的二次空间和时间复杂度,在处理长序列时效率不高。为克服这一限制,Linformer 和 Informer 分别通过低维投影和行选择将二次复杂度降低至线性(模对数因子)。这两种模型内在相连,为理解其联系,我们引入了矩阵草图(matrix sketching)的理论框架。基于该理论分析,我们提出 Skeinformer 以加速自注意力,并通过三个精心设计的组件——列采样、自适应行归一化与引导采样复用——进一步提升了自注意力矩阵近似的精度。在 Long Range Arena (LRA) 基准上的实验表明,我们的方法以持续更小的时空占用优于其他替代方案。
引用
@article{arxiv.2112.05359,
title = {Sketching as a Tool for Understanding and Accelerating Self-attention for Long Sequences},
author = {Yifan Chen and Qi Zeng and Dilek Hakkani-Tur and Di Jin and Heng Ji and Yun Yang},
journal= {arXiv preprint arXiv:2112.05359},
year = {2021}
}