会发声的物体
计算机视觉与模式识别
2018-07-27 v2 机器学习
多媒体
声音
音频与语音处理
摘要
在本文中,我们的目标一是构建能够将音频与视觉输入嵌入适合跨模态检索的共享空间的网络;二是构建在给定音频信号时能在图像中定位发声物体的网络。我们通过仅以视听对应(AVC)作为目标函数、从未经标注的视频中训练,实现了这两个目标。这是一种来自视频的跨模态自监督形式。为此,我们设计了新的网络架构,可利用 AVC 任务训练用于跨模态检索及图像中声源定位。我们的贡献如下:(i)表明可以学习到支持同模态(如音频到音频)与跨模态检索的音频与视觉嵌入;(ii)探索了用于 AVC 任务的多种架构,包括摄入单张图像、多张图像、或单张图像与多帧光流的视觉流架构;(iii)表明图像中会发声的语义物体可被定位(仅利用声音,无需运动或光流信息);(iv)给出了关于如何在数据准备中避免不良捷径的警示。
引用
@article{arxiv.1712.06651,
title = {Objects that Sound},
author = {Relja Arandjelović and Andrew Zisserman},
journal= {arXiv preprint arXiv:1712.06651},
year = {2018}
}
备注
Appears in: European Conference on Computer Vision (ECCV) 2018