LA-VocE:基于神经声码器的低信噪比视听语音增强
声音
2023-03-14 v2 计算机视觉与模式识别
机器学习
音频与语音处理
摘要
视听语音增强旨在利用音频本身以及目标说话人的唇部运动,从噪声环境中提取干净语音。该方法已被证明优于仅基于音频的语音增强,尤其在去除干扰语音方面。尽管语音合成近期取得进展,多数视听方法仍沿用谱映射/掩蔽来重建干净音频,通常只是在现有语音增强架构上添加视觉骨干网络。本工作中,我们提出 LA-VocE,一种新颖的两阶段方法:通过基于 transformer 的架构从含噪视听语音预测梅尔谱图,随后使用神经声码器(HiFi-GAN)将其转为波形音频。我们在数千名说话人与 11 种以上不同语言上训练并评估了我们的框架,并研究了模型对不同背景噪声与语音干扰水平的适应能力。实验表明,根据多项指标 LA-VocE 优于现有方法,尤其在极强噪声场景下。
引用
@article{arxiv.2211.10999,
title = {LA-VocE: Low-SNR Audio-visual Speech Enhancement using Neural Vocoders},
author = {Rodrigo Mira and Buye Xu and Jacob Donley and Anurag Kumar and Stavros Petridis and Vamsi Krishna Ithapu and Maja Pantic},
journal= {arXiv preprint arXiv:2211.10999},
year = {2023}
}
备注
accepted to ICASSP 2023