中文

草图技术作为理解与加速长序列自注意力的工具

机器学习 2021-12-13 v1 计算与语言 机器学习

摘要

基于 Transformer 的模型由于自注意力模块的二次空间和时间复杂度,在处理长序列时效率不高。为克服这一限制,Linformer 和 Informer 分别通过低维投影和行选择将二次复杂度降低至线性(模对数因子)。这两种模型内在相连,为理解其联系,我们引入了矩阵草图(matrix sketching)的理论框架。基于该理论分析,我们提出 Skeinformer 以加速自注意力,并通过三个精心设计的组件——列采样、自适应行归一化与引导采样复用——进一步提升了自注意力矩阵近似的精度。在 Long Range Arena (LRA) 基准上的实验表明,我们的方法以持续更小的时空占用优于其他替代方案。

关键词

引用

@article{arxiv.2112.05359,
  title  = {Sketching as a Tool for Understanding and Accelerating Self-attention for Long Sequences},
  author = {Yifan Chen and Qi Zeng and Dilek Hakkani-Tur and Di Jin and Heng Ji and Yun Yang},
  journal= {arXiv preprint arXiv:2112.05359},
  year   = {2021}
}