360 视频空间音频的自监督生成
声音
2018-09-10 v1 计算机视觉与模式识别
机器学习
多媒体
音频与语音处理
摘要
我们引入一种方法,将 360 视频相机记录的单声道音频转换为空间音频,即声音在整个视球上分布的表示。空间音频是沉浸式 360 视频观看的重要组件,但在当前 360 视频制作中空间音频麦克风仍属罕见。我们的系统由端到端可训练神经网络组成,其基于音频与 360 视频帧的多模态分析,分离个别声源并将其定位在视球上。我们引入了若干数据集,包括一个我们自己拍摄的,以及一个从 YouTube 野外部署收集的、由上传时带空间音频的 360 视频组成的数据集。训练期间,真值空间音频作为自监督,而混缩的单声道轨作为我们网络的输入。利用我们的方法,我们展示了仅基于 360 视频与单声道音频轨推断声源空间位置的可能性。
引用
@article{arxiv.1809.02587,
title = {Self-Supervised Generation of Spatial Audio for 360 Video},
author = {Pedro Morgado and Nuno Vasconcelos and Timothy Langlois and Oliver Wang},
journal= {arXiv preprint arXiv:1809.02587},
year = {2018}
}
备注
To appear in NIPS 2018