中文

注意力机制优于矩阵分解吗?

计算机视觉与模式识别 2021-12-30 v2 机器学习

摘要

作为现代深度学习的基本要素,注意力机制,尤其是自注意力机制,在全局相关性发现中发挥着至关重要的作用。然而,在建模全局上下文时,手工设计的注意力机制是否不可替代?我们发现,在编码长距离依赖的性能和计算成本方面,自注意力机制并不优于20年前提出的矩阵分解(MD)模型。我们将全局上下文问题建模为一个低秩恢复问题,并表明其优化算法有助于设计全局信息模块。本文随后提出了一系列Hamburgers,其中我们采用求解MD的优化算法将输入表示分解为子矩阵,并重构出低秩嵌入。在仔细处理通过MD反向传播的梯度时,采用不同MD的Hamburgers在与流行的全局上下文模块自注意力机制相比时表现良好。我们在学习全局上下文至关重要的视觉任务中进行了综合实验,包括语义分割和图像生成,结果表明相较于自注意力机制及其变体有显著改进。

关键词

引用

@article{arxiv.2109.04553,
  title  = {Is Attention Better Than Matrix Decomposition?},
  author = {Zhengyang Geng and Meng-Hao Guo and Hongxu Chen and Xia Li and Ke Wei and Zhouchen Lin},
  journal= {arXiv preprint arXiv:2109.04553},
  year   = {2021}
}

备注

ICLR 2021