简便定位视觉声源的方法
计算机视觉与模式识别
2022-03-30 v2 机器学习
多媒体
声音
音频与语音处理
摘要
无监督视听源定位旨在不依赖训练用的真值定位的情况下,在视频中定位可见的发声源。先前的工作通常对可能的正(发声)区域寻求高视听相似度,对可能的负区域寻求低相似度。然而,在没有人工标注的情况下准确区分发声与非发声区域具有挑战性。在本工作中,我们提出了一种简单而有效的简便视觉声源定位方法,即EZ-VSL,其在训练期间不依赖正和/或负区域的构建。相反,我们通过寻求至少在与图像的一个位置对齐、且不与任何其他图像在任何位置匹配的视听表示,来对齐音频与视觉空间。我们还引入了一种新颖的推理时物体引导定位方案以提高精度。我们简单有效的框架在两个流行基准Flickr SoundNet和VGG-Sound Source上取得了最先进的性能。特别地,我们将Flickr SoundNet测试集的CIoU从76.80%提升至83.94%,在VGG-Sound Source数据集上从34.60%提升至38.85%。代码可在 https://github.com/stoneMo/EZ-VSL 获取。
引用
@article{arxiv.2203.09324,
title = {Localizing Visual Sounds the Easy Way},
author = {Shentong Mo and Pedro Morgado},
journal= {arXiv preprint arXiv:2203.09324},
year = {2022}
}