中文

基于深度学习的伦巴第效应下的视听语音增强

音频与语音处理 2019-11-05 v1 机器学习

摘要

当在背景噪声存在的情况下说话时,人类会反射性地改变其说话方式以提高语音的可懂度。这种反射被称为伦巴第效应(Lombard effect)。收集伦巴第条件下的语音通常困难且成本高昂。因此,语音增强系统一般在安静环境下录制的语音上人工加噪后进行训练和评估。由于这些系统常用于出现伦巴第语音的场景,本文中我们分析了伦巴第效应对音频、视觉及视听语音增强的影响,重点关注基于深度学习的系统,因为它们代表了该领域当前的最先进水平(state of the art)。我们使用由54位不同说话人发出的语句组成的视听伦巴第语音语料库进行了若干实验。结果表明,在低信噪比下,使用伦巴第语音训练基于深度学习的模型在估计语音质量和估计语音可懂度方面均有裨益,此时视觉模态在声学挑战性情境中可发挥重要作用。我们还发现男女之间存在性能差异,这是由于男性和女性表现出不同的伦巴第语音,并围绕声学与视觉特征对其进行了分析。此外,使用视听刺激进行的听音测试表明,在信噪比为-5 dB时,用伦巴第语音训练的系统处理所得信号之语音质量,在统计上显著优于用非伦巴第语音训练的系统。关于语音可懂度,我们发现用伦巴第语音训练系统总体呈获益趋势。

关键词

引用

@article{arxiv.1905.12605,
  title  = {Deep-Learning-Based Audio-Visual Speech Enhancement in Presence of Lombard Effect},
  author = {Daniel Michelsanti and Zheng-Hua Tan and Sigurdur Sigurdsson and Jesper Jensen},
  journal= {arXiv preprint arXiv:1905.12605},
  year   = {2019}
}