中文

BinauralGrad:一种用于双耳音频合成的两阶段条件扩散概率模型

音频与语音处理 2022-11-30 v2 机器学习 声音

摘要

双耳音频在构建沉浸式增强现实与虚拟现实中发挥着重要作用。由于从真实世界中录制双耳音频成本高昂,从单声道音频合成双耳音频已引起越来越多的关注。该合成过程不仅涉及单声道音频的基本物理扭曲,还涉及房间混响以及与头部/耳朵相关的滤波,然而这些在传统数字信号处理中难以精确模拟。在本文中,我们通过将双耳音频分解为左右声道共享的公共部分以及各声道不同的特定部分,从不同的视角来表述该合成过程。相应地,我们提出了 BinauralGrad,一种配备扩散模型以分别合成这两部分的新颖两阶段框架。具体而言,在第一阶段,以单声道音频为条件,利用单通道扩散模型生成双耳音频的公共信息;在此基础上,第二阶段通过双通道扩散模型生成双耳音频。将这一两阶段合成的新视角与先进的生成模型(即扩散模型)相结合,所提出的 BinauralGrad 能够生成准确且高保真度的双耳音频样本。实验结果表明,在一个基准数据集上,BinauralGrad 在客观与主观评价指标上均以较大优势优于现有基线(Wave L2:0.128 对比 0.157,MOS:3.80 对比 3.61)。生成的音频样本(https://speechresearch.github.io/binauralgrad)与代码(https://github.com/microsoft/NeuralSpeech/tree/master/BinauralGrad)已在线提供。

关键词

引用

@article{arxiv.2205.14807,
  title  = {BinauralGrad: A Two-Stage Conditional Diffusion Probabilistic Model for Binaural Audio Synthesis},
  author = {Yichong Leng and Zehua Chen and Junliang Guo and Haohe Liu and Jiawei Chen and Xu Tan and Danilo Mandic and Lei He and Xiang-Yang Li and Tao Qin and Sheng Zhao and Tie-Yan Liu},
  journal= {arXiv preprint arXiv:2205.14807},
  year   = {2022}
}

备注

NeurIPS 2022 camera version