中文

通过上下文信息的交互式对比学习迈向精确的弱监督目标检测

计算机视觉与模式识别 2023-05-08 v2

摘要

弱监督目标检测 (WSOD) 旨在仅使用图像级标签学习精确的目标检测器。尽管过去几年在深度学习 (DL) 方法上进行了深入研究,但 WSOD 与全监督目标检测之间仍存在显著的性能差距。事实上,大多数现有的 WSOD 方法仅考虑每个候选区域的视觉外观,而忽略了利用图像中有用的上下文信息。为此,本文提出了一个名为 JLWSOD 的交互式端到端 WSOD 框架,具有两项创新:i) 提出并将两种特定于 WSOD 的上下文信息(即实例级相关性和语义级相关性)引入 WSOD 框架;ii) 设计了交互式图对比学习 机制,以联合优化视觉外观和上下文信息,从而获得更好的 WSOD 性能。具体而言,iGCL 机制充分利用了 WSOD 的互补解释,即实例级检测和语义级预测任务,形成了一个更全面的解决方案。在广泛使用的 PASCAL VOC 和 MS COCO 基准测试上的大量实验验证了 JLWSOD 相对于其他最先进方法和基线模型的优越性(在 mAP 上提升了 3.6%~23.3%,在 CorLoc 上提升了 3.4%~19.7%)。

关键词

引用

@article{arxiv.2304.14114,
  title  = {Towards Precise Weakly Supervised Object Detection via Interactive Contrastive Learning of Context Information},
  author = {Qi Lai and ChiMan Vong},
  journal= {arXiv preprint arXiv:2304.14114},
  year   = {2023}
}