中文

通过观看无标签视频学习分离物体声音

计算机视觉与模式识别 2018-07-27 v2 多媒体 声音 音频与语音处理

摘要

最充分地感知一个场景需要所有感官。然而,对物体外观与声音进行建模具有挑战性:大多数自然场景与事件包含多个物体,且音轨将所有声源混合在一起。我们提出从无标签视频中学习视听物体模型,然后利用视觉上下文在新视频中执行音频源分离。我们的方法依赖于深度多示例多标签学习框架,以解开映射到单个视觉物体的音频频率基,即便未孤立地观察/听到这些物体。我们展示了如何利用恢复的解开基来引导音频源分离,以获得分离更好的物体级声音。我们的工作是首个从包含每视频多个音频源的大规模“野生”视频中学习音频源分离的。我们在视觉辅助音频源分离与音频去噪上取得了 SOTA 结果。我们的视频结果:http://vision.cs.utexas.edu/projects/separating_object_sounds/

关键词

引用

@article{arxiv.1804.01665,
  title  = {Learning to Separate Object Sounds by Watching Unlabeled Video},
  author = {Ruohan Gao and Rogerio Feris and Kristen Grauman},
  journal= {arXiv preprint arXiv:1804.01665},
  year   = {2018}
}

备注

Published in ECCV 2018; Project Page: http://vision.cs.utexas.edu/projects/separating_object_sounds/