中文

无需双耳音频的视觉引导双耳音频生成

声音 2021-04-14 v1 计算机视觉与模式识别 多媒体 音频与语音处理

摘要

立体声音频,尤其是双耳音频,在沉浸式观看环境中起着至关重要的作用。近期研究探索了以多通道音频集合为监督、生成视觉引导立体声音频的方法。然而,由于需要专业录音设备,现有数据集在规模与多样性上受限,阻碍了监督方法在真实场景中的泛化。本文提出 PseudoBinaural,一种无需双耳录音的高效流程。其核心思路是利用单声道数据精心构建伪视觉-立体声对用于训练。具体而言,我们利用球谐分解与头相关脉冲响应(HRIR)来确立空间位置与接收到的双耳音频之间的关系。随后在视觉模态中,将单声道数据对应的视觉线索手动放置于声源位置以形成配对。与全监督范式相比,我们的免双耳录音流程在跨数据集评测中表现出极佳的稳定性,并在主观偏好下取得可比性能。此外,结合双耳录音时,我们的方法能够在监督设定下进一步提升双耳音频生成的性能。

关键词

引用

@article{arxiv.2104.06162,
  title  = {Visually Informed Binaural Audio Generation without Binaural Audios},
  author = {Xudong Xu and Hang Zhou and Ziwei Liu and Bo Dai and Xiaogang Wang and Dahua Lin},
  journal= {arXiv preprint arXiv:2104.06162},
  year   = {2021}
}

备注

Accepted by CVPR 2021. Code, models, and demo video are available on our webpage: \<https://sheldontsui.github.io/projects/PseudoBinaural>