中文

AV2Wav:基于扩散的从连续自监督特征重合成用于音视频语音增强

音频与语音处理 2024-11-05 v5 计算与语言 声音

摘要

语音增强系统通常使用干净语音与带噪语音的配对进行训练。在音视频语音增强(AVSE)中,可用的真值干净数据较少;大多数音视频数据集是在具有背景噪声与混响的真实世界环境中收集的,这阻碍了 AVSE 的发展。在本工作中,我们引入 AV2Wav,一种基于重合成的音视频语音增强方法,尽管存在真实世界训练数据的挑战,仍能生成干净语音。我们使用神经质量估计器从音视频语料中获取近乎干净的语音子集,然后在该子集上训练扩散模型,以 AV-HuBERT 的连续语音表示并结合噪声鲁棒训练来生成波形。我们使用连续而非离散表示以保留韵律与说话人信息。仅凭借该声码任务,该模型就能比基于掩蔽的基线更好地执行语音增强。我们进一步在干净/带噪语句配对上微调扩散模型以提升性能。我们的方法在自动指标与人类试听测试两方面均优于基于掩蔽的基线,并在试听测试中质量接近目标语音。音频样本可在 https://home.ttic.edu/~jcchou/demo/avse/avse_demo.html 找到。

关键词

引用

@article{arxiv.2309.08030,
  title  = {AV2Wav: Diffusion-Based Re-synthesis from Continuous Self-supervised Features for Audio-Visual Speech Enhancement},
  author = {Ju-Chieh Chou and Chung-Ming Chien and Karen Livescu},
  journal= {arXiv preprint arXiv:2309.08030},
  year   = {2024}
}

备注

extended version for the accepted paper at ICASSP 2024