局部增强自注意力:将自注意力与卷积作为局部与上下文项结合
计算机视觉与模式识别
2021-11-30 v3
摘要
自注意力已在计算机视觉模型中变得普遍。受全连接条件随机场(CRFs)启发,我们将自注意力分解为局部项与上下文项。它们对应于 CRF 中的一元项与二元项,并由带投影矩阵的注意力机制实现。我们观察到一元项仅对输出贡献很小,同时仅依赖一元项的标准 CNN 在多种任务上取得了优异性能。因此,我们提出局部增强自注意力(LESA),其通过将一元项与卷积结合来增强一元项,并利用融合模块动态耦合一元与二元操作。在我们的实验中,我们用 LESA 替换自注意力模块。在 ImageNet 与 COCO 上的结果表明,对于图像识别、目标检测与实例分割任务,LESA 优于卷积与自注意力基线。代码已公开可用。
引用
@article{arxiv.2107.05637,
title = {Locally Enhanced Self-Attention: Combining Self-Attention and Convolution as Local and Context Terms},
author = {Chenglin Yang and Siyuan Qiao and Adam Kortylewski and Alan Yuille},
journal= {arXiv preprint arXiv:2107.05637},
year = {2021}
}