中文

基于音视觉对应关系的自监督目标检测

计算机视觉与模式识别 2022-07-12 v2

摘要

我们解决了在无监督情况下学习目标检测器的问题。与弱监督目标检测不同,我们不假设图像级别的类别标签。相反,我们从音视觉数据中提取监督信号,利用音频成分来“教导”目标检测器。虽然该问题与声源定位相关,但难度更大,因为检测器必须按类型对目标进行分类,枚举每个目标实例,并且即使在目标静音时也能做到。我们通过首先设计一个具有对比目标的自监督框架来解决该问题,该框架联合学习对目标进行分类和定位。然后,在不使用任何监督的情况下,我们简单地使用这些自监督标签和边界框来训练基于图像的目标检测器。借此,我们在目标检测和声源定位任务上优于以往的无监督和弱监督检测器。我们还表明,我们可以用每个伪类别仅一个标签将检测器对齐到真实类别,并展示我们的方法如何学会检测超出乐器之外的通用目标,如飞机和猫。

关键词

引用

@article{arxiv.2104.06401,
  title  = {Self-supervised object detection from audio-visual correspondence},
  author = {Triantafyllos Afouras and Yuki M. Asano and Francois Fagan and Andrea Vedaldi and Florian Metze},
  journal= {arXiv preprint arXiv:2104.06401},
  year   = {2022}
}

备注

Accepted to CVPR 2022