中文

Points2Sound:利用三维点云场景从单声道生成双耳音频

声音 2023-05-22 v3 计算机视觉与模式识别 音频与语音处理

摘要

对于沉浸式应用而言,生成与视觉内容相匹配的双耳声音对于在虚拟环境中为人们带来有意义的体验至关重要。近期研究表明,利用二维视觉信息作为引导,可通过神经网络从单声道音频合成双耳音频。通过以三维视觉信息引导音频并在波形域中处理,可进一步扩展该方法,从而实现对虚拟音频场景更精确的声化。我们提出 Points2Sound,一种利用三维点云场景从单声道音频生成双耳版本的多模态深度学习模型。具体而言,Points2Sound 由一个视觉网络和一个音频网络组成。视觉网络使用三维稀疏卷积从点云场景中提取视觉特征。随后,该视觉特征对工作在波形域的音频网络进行条件化,以合成双耳版本。结果表明,三维视觉信息能够成功引导多模态深度学习模型完成双耳合成任务。我们还研究了三维点云属性、学习目标、不同混响条件以及多种单声道混合信号如何影响 Points2Sound 在场景中存在不同数量声源时的双耳音频合成性能。

关键词

引用

@article{arxiv.2104.12462,
  title  = {Points2Sound: From mono to binaural audio using 3D point cloud scenes},
  author = {Francesc Lluís and Vasileios Chatziioannou and Alex Hofmann},
  journal= {arXiv preprint arXiv:2104.12462},
  year   = {2023}
}

备注

Code, data, and listening examples: https://github.com/francesclluis/points2sound