中文

眼见未必为实:通过蒸馏多模态知识实现基于声音的自监督多目标检测与跟踪

计算机视觉与模式识别 2021-11-05 v1 机器学习 机器人学

摘要

物体固有的声音属性可为学习丰富的目标检测和跟踪表征提供宝贵线索。此外,视频中视听事件的共现可被利用,仅通过监测环境中的声音即可在图像场上定位物体。迄今为止,这仅在相机静止且用于单目标检测的场景中可行。而且,这些方法的鲁棒性有限,因为它们主要依赖极易受光照和天气变化影响的RGB图像。在本工作中,我们提出了新颖的自监督MM-DistillNet框架,其由多个教师组成,利用包括RGB、深度和热成像在内的多样模态,同时挖掘互补线索并将知识蒸馏到单一的音频学生网络中。我们提出了新的MTA损失函数,以自监督方式促进来自多模态教师的信息蒸馏。此外,我们为音频学生提出了一种新颖的自监督 pretext task,使我们无需依赖费力的手动标注。我们引入了一个大规模多模态数据集,包含超过113,000帧时间同步的RGB、深度、热成像和音频模态数据。大量实验表明,我们的方法优于最先进的方法,同时能够在推理时仅使用声音甚至在移动中检测多个目标。

关键词

引用

@article{arxiv.2103.01353,
  title  = {There is More than Meets the Eye: Self-Supervised Multi-Object Detection and Tracking with Sound by Distilling Multimodal Knowledge},
  author = {Francisco Rivera Valverde and Juana Valeria Hurtado and Abhinav Valada},
  journal= {arXiv preprint arXiv:2103.01353},
  year   = {2021}
}

备注

Accepted at CVPR 2021. Dataset, code and models are available at http://rl.uni-freiburg.de/research/multimodal-distill