2.5D 视觉声音
计算机视觉与模式识别
2019-04-10 v4
摘要
双耳音频为听者提供 3D 声音感觉,允许对场景的丰富感知体验。然而,双耳录音极少可得,且需要非平凡的专门知识与设备来获取。我们提出利用视频将常见的单声道音频转换为双耳音频。核心思想是,视觉帧揭示了显著的空间线索,这些线索虽然在伴随的单通道音频中显式缺失,却与之强相关。我们的多模态方法从未标注视频中恢复此联系。我们设计了一个深度卷积神经网络,通过学习注入关于物体与场景配置的视觉信息,将单声道(单通道)音轨解码为其双耳对应物。我们将所得输出称为 2.5D 视觉声音——视觉流有助于将扁平的单通道音频“提升”为空间化声音。除声音生成外,我们展示了我们网络学到的自监督表示有益于视听源分离。我们的视频结果:http://vision.cs.utexas.edu/projects/2.5D_visual_sound/
引用
@article{arxiv.1812.04204,
title = {2.5D Visual Sound},
author = {Ruohan Gao and Kristen Grauman},
journal= {arXiv preprint arXiv:1812.04204},
year = {2019}
}
备注
Published in CVPR 2019, project page: http://vision.cs.utexas.edu/projects/2.5D_visual_sound/