中文

共分离视觉物体的声音

计算机视觉与模式识别 2019-08-22 v2 多媒体 声音 音频与语音处理

摘要

从视频中学习物体如何发声具有挑战性,因为它们在单个音频通道中经常严重重叠。当前基于视觉引导的音频源分离方法通过使用人工混合的视频片段进行训练来回避这个问题,但这给训练数据收集带来了笨拙的限制,甚至可能阻止学习“真实”混合声音的属性。我们引入了一种共分离训练范式,允许从未标记的多源视频中学习物体级别的声音。我们新颖的训练目标要求深度神经网络对相似外观物体分离出的音频具有一致的可识别性,同时为每个源训练对精确再现视频级别的音频轨道。我们的方法在真实测试视频中解缠了声音,即使在训练期间未单独观察到某个物体的情况下也是如此。我们在MUSIC、AudioSet和AV-Bench数据集上,在基于视觉引导的音频源分离和音频去噪方面取得了最先进的结果。

关键词

引用

@article{arxiv.1904.07750,
  title  = {Co-Separating Sounds of Visual Objects},
  author = {Ruohan Gao and Kristen Grauman},
  journal= {arXiv preprint arXiv:1904.07750},
  year   = {2019}
}

备注

ICCV 2019, Project page: http://vision.cs.utexas.edu/projects/coseparation/