用于细粒度视觉分类与对象重识别的双重交叉注意力学习
计算机视觉与模式识别
2022-05-05 v1 人工智能
机器学习
摘要
近年来,自注意力机制在各种NLP和CV任务中展现出令人印象深刻的性能,能够帮助捕捉序列特征并提取全局信息。在本工作中,我们探索如何扩展自注意力模块以更好地学习用于识别细粒度对象的细微特征嵌入,例如不同鸟类物种或行人身份。为此,我们提出一种双重交叉注意力学习(DCAL)算法来与自注意力学习相协同。首先,我们提出全局-局部交叉注意力(GLCA)以增强全局图像与局部高响应区域之间的交互,这有助于强化用于识别的空间判别线索。其次,我们提出成对交叉注意力(PWCA)以建立图像对之间的交互。PWCA通过将另一幅图像作为干扰项来正则化一幅图像的自注意力学习,并在推理时被移除。我们观察到DCAL能够减少误导性注意力并将注意力响应扩散以发现更多互补的判别部位用于识别。我们在细粒度视觉分类和对象重识别上进行了大量评估。实验表明,DCAL与最先进(state-of-the-art)方法性能相当,并持续提升了多个自注意力基线,例如在MSMT17上分别超越DeiT-Tiny和ViT-Base达2.8%和2.4% mAP。
引用
@article{arxiv.2205.02151,
title = {Dual Cross-Attention Learning for Fine-Grained Visual Categorization and Object Re-Identification},
author = {Haowei Zhu and Wenjing Ke and Dong Li and Ji Liu and Lu Tian and Yi Shan},
journal= {arXiv preprint arXiv:2205.02151},
year = {2022}
}
备注
Accepted by CVPR 2022