中文

面向虚拟现实的利用视听线索生成全景声的方法

声音 2019-08-20 v1 计算机视觉与模式识别 机器学习 多媒体 音频与语音处理

摘要

全景声(即全球面环绕声)与 360 度视觉内容相结合,对于提供逼真的虚拟现实(VR)体验至关重要。尽管 360 度视觉内容捕获近年来取得了巨大进展,但由于需要声场麦克风或声源位置信息,相应空间声音的估计仍具挑战性。本文引入了一个利用视听线索在 360 度视频中生成全景声的新问题。为此,首先引入了一个包含 265 个视频的带标注声源位置的新型 360 度视听视频数据集。其次,设计了一个用于自动全景声估计问题的流水线。受益于基于深度学习的视听特征嵌入与预测模块,我们的流水线估计 3D 声源位置,并进一步利用这些位置编码为 B-format。为对我们的数据集和流水线进行基准测试,我们额外提出了评估标准,以使用不同的 360 度输入表示来考察性能。我们的结果证明了所提流水线的有效性,并为未来研究开辟了 360 度视听分析的新领域。

关键词

引用

@article{arxiv.1908.06752,
  title  = {Towards Generating Ambisonics Using Audio-Visual Cue for Virtual Reality},
  author = {Aakanksha Rana and Cagri Ozcinar and Aljoscha Smolic},
  journal= {arXiv preprint arXiv:1908.06752},
  year   = {2019}
}

备注

ICASSP 2019 - 2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)