中文

局部增强自注意力:将自注意力与卷积作为局部与上下文项结合

计算机视觉与模式识别 2021-11-30 v3

摘要

自注意力已在计算机视觉模型中变得普遍。受全连接条件随机场(CRFs)启发,我们将自注意力分解为局部项与上下文项。它们对应于 CRF 中的一元项与二元项,并由带投影矩阵的注意力机制实现。我们观察到一元项仅对输出贡献很小,同时仅依赖一元项的标准 CNN 在多种任务上取得了优异性能。因此,我们提出局部增强自注意力(LESA),其通过将一元项与卷积结合来增强一元项,并利用融合模块动态耦合一元与二元操作。在我们的实验中,我们用 LESA 替换自注意力模块。在 ImageNet 与 COCO 上的结果表明,对于图像识别、目标检测与实例分割任务,LESA 优于卷积与自注意力基线。代码已公开可用。

关键词

引用

@article{arxiv.2107.05637,
  title  = {Locally Enhanced Self-Attention: Combining Self-Attention and Convolution as Local and Context Terms},
  author = {Chenglin Yang and Siyuan Qiao and Adam Kortylewski and Alan Yuille},
  journal= {arXiv preprint arXiv:2107.05637},
  year   = {2021}
}