无需双耳音频的视觉引导双耳音频生成
声音
2021-04-14 v1 计算机视觉与模式识别
多媒体
音频与语音处理
摘要
立体声音频,尤其是双耳音频,在沉浸式观看环境中起着至关重要的作用。近期研究探索了以多通道音频集合为监督、生成视觉引导立体声音频的方法。然而,由于需要专业录音设备,现有数据集在规模与多样性上受限,阻碍了监督方法在真实场景中的泛化。本文提出 PseudoBinaural,一种无需双耳录音的高效流程。其核心思路是利用单声道数据精心构建伪视觉-立体声对用于训练。具体而言,我们利用球谐分解与头相关脉冲响应(HRIR)来确立空间位置与接收到的双耳音频之间的关系。随后在视觉模态中,将单声道数据对应的视觉线索手动放置于声源位置以形成配对。与全监督范式相比,我们的免双耳录音流程在跨数据集评测中表现出极佳的稳定性,并在主观偏好下取得可比性能。此外,结合双耳录音时,我们的方法能够在监督设定下进一步提升双耳音频生成的性能。
引用
@article{arxiv.2104.06162,
title = {Visually Informed Binaural Audio Generation without Binaural Audios},
author = {Xudong Xu and Hang Zhou and Ziwei Liu and Bo Dai and Xiaogang Wang and Dahua Lin},
journal= {arXiv preprint arXiv:2104.06162},
year = {2021}
}
备注
Accepted by CVPR 2021. Code, models, and demo video are available on our webpage: \<https://sheldontsui.github.io/projects/PseudoBinaural>