中文

质心变换器:利用注意力学习抽象

机器学习 2021-03-09 v2 机器学习

摘要

自注意力作为变换器(transformers)的关键模块,是从输入中提取特征的强大机制。本质上,自注意力推断输入元素间的成对关系,并通过在输入对间传播信息来修改输入。因此,它将输入映射为 N 个输出,并带来二次的 O(N2)O(N^2) 内存与时间复杂度。我们提出质心注意力,一种将 N 个输入映射为 M 个输出 (MN)(M\leq N) 的自注意力推广,使得输入中的关键信息被汇总于较少数量的输出(称为质心)中。我们通过摊销输入上聚类目标函数的梯度下降更新规则来设计质心注意力,这揭示了注意力与聚类间的潜在联系。通过将输入压缩至质心,我们提取了对预测有用的关键信息,并减少了注意力模块及后续层的计算量。我们将该方法应用于多种任务,包括抽象文本摘要、3D 视觉和图像处理。实证结果展示了我们的方法相对于标准变换器的有效性。

关键词

引用

@article{arxiv.2102.08606,
  title  = {Centroid Transformers: Learning to Abstract with Attention},
  author = {Lemeng Wu and Xingchao Liu and Qiang Liu},
  journal= {arXiv preprint arXiv:2102.08606},
  year   = {2021}
}