中文

多样实例发现:用于实例感知多标签图像识别的视觉Transformer

计算机视觉与模式识别 2022-04-25 v1

摘要

先前关于多标签图像识别(MLIR)的工作通常以CNN作为研究起点。本文以纯视觉Transformer(ViT)为研究基础,充分利用Transformer的长程依赖建模优势,规避CNN受限于局部感受野的缺点。然而,对于包含来自不同类别、尺度和空间关系的多个物体的多标签图像,仅使用全局信息并非最优。我们的目标是通过ViT的块令牌与自注意力机制挖掘多标签图像中丰富的实例,称为多样实例发现(DiD)。为此,我们分别提出语义类别感知模块和空间关系感知模块,随后通过再约束策略将二者结合以获得实例感知注意力图。最后,我们提出一种基于弱监督目标定位的方法来提取多尺度局部特征,以形成多视角流程。我们的方法仅需标签级别的弱监督信息,无需额外的知识注入或其他强监督信息。在三个基准数据集上的实验表明,在公平实验对比下,我们的方法显著优于先前工作并取得了最先进(state-of-the-art)结果。

关键词

引用

@article{arxiv.2204.10731,
  title  = {Diverse Instance Discovery: Vision-Transformer for Instance-Aware Multi-Label Image Recognition},
  author = {Yunqing Hu and Xuan Jin and Yin Zhang and Haiwen Hong and Jingfeng Zhang and Feihu Yan and Yuan He and Hui Xue},
  journal= {arXiv preprint arXiv:2204.10731},
  year   = {2022}
}

备注

Accepted to ICME 2022