中文

以困难方式定位视觉声源

计算机视觉与模式识别 2021-04-07 v1 音频与语音处理 图像与视频处理

摘要

本工作的目标是在不使用人工标注的情况下,定位视频中可见的声源。我们的关键技术贡献在于表明,通过训练网络显式区分具有挑战性的图像片段——即便对于确实包含发声物体的图像——也能显著提升定位性能。我们优雅地引入了一种机制来挖掘困难样本,并将其自动加入对比学习公式中。我们表明,我们的算法在流行的 Flickr SoundNet 数据集上达到了最先进的性能。此外,我们引入了 VGG-Sound Source (VGG-SS) 基准,这是针对最近提出的 VGG-Sound 数据集的一组新标注,其中每个视频片段中可见的声源都用边界框标注明确标出。该数据集比类似的现有数据集大 20 倍,包含跨越 200 多个类别的 5K 视频,并且与 Flickr SoundNet 不同,它是基于视频的。在 VGG-SS 上,我们也展示了我们的算法相对于多个基线取得了最先进的性能。

关键词

引用

@article{arxiv.2104.02691,
  title  = {Localizing Visual Sounds the Hard Way},
  author = {Honglie Chen and Weidi Xie and Triantafyllos Afouras and Arsha Nagrani and Andrea Vedaldi and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2104.02691},
  year   = {2021}
}

备注

CVPR2021