用于视觉与语言建模的多尺度自注意力卷积
机器学习
2019-12-04 v1 计算与语言
计算机视觉与模式识别
机器学习
摘要
自注意力机制已成为许多最先进语言理解模型中的关键构建模块。在本文中,我们表明自注意力算子可以用 1x1 卷积运算来表示。基于这一观察,我们提出了几种新颖的算子:首先,我们引入了适用于图像等 2D 信号的 2D 版本自注意力。其次,我们提出了 1D 和 2D 自注意力卷积(SAC)算子,该算子将自注意力从 1x1 卷积分别推广到 1xm 和 nxm 卷积。虽然 1D 和 2D 自注意力作用于单个词和像素,SAC 分别作用于 m-gram 和图像块。第三,我们提出了 SAC 的多尺度版本(MSAC),它通过并行采用多个滤波器大小不同的 SAC 算子来分析输入。最后,我们解释了如何将 MSAC 用于视觉和语言建模,并进一步利用 MSAC 构建交叉注意力图像相似性机制。
引用
@article{arxiv.1912.01521,
title = {Multiscale Self Attentive Convolutions for Vision and Language Modeling},
author = {Oren Barkan},
journal= {arXiv preprint arXiv:1912.01521},
year = {2019}
}