中文

基于Transformer的多实例学习用于弱监督目标检测

计算机视觉与模式识别 2023-03-28 v1

摘要

弱监督目标检测(WSOD)使得仅使用图像级标注即可训练目标检测模型成为可能。最先进的WSOD检测器通常依赖多实例学习(MIL)作为检测器的主干,并假设一幅图像的边界框提议彼此独立。然而,由于此类方法仅利用得分最高的提议而丢弃其他提议中潜在有用的信息,其独立的MIL主干常将模型限制于物体的显著部分,或导致每类仅检测一个物体。为解决上述问题,我们提出了一种基于定制视觉Transformer(Vision Transformer)的WSOD新主干,称为弱监督Transformer检测网络(WSTDN)。我们的算法不仅是首个证明考虑实例间关系的自注意力模块可作为WSOD有效主干的工作,还引入了一种新颖的边界框挖掘方法(BBM)并与记忆迁移精炼(MTR)过程相集成,以利用实例依赖关系促进实例精炼。在PASCAL VOC2007和VOC2012基准上的实验结果证明了我们所提WSTDN及改进实例精炼模块的有效性。

关键词

引用

@article{arxiv.2303.14999,
  title  = {Transformer-based Multi-Instance Learning for Weakly Supervised Object Detection},
  author = {Zhaofei Wang and Weijia Zhang and Min-Ling Zhang},
  journal= {arXiv preprint arXiv:2303.14999},
  year   = {2023}
}