探究 Lombard 效应对端到端音视觉语音识别的影响
音频与语音处理
2019-07-10 v4 计算机视觉与模式识别
图像与视频处理
摘要
近来提出了若干音视觉语音识别模型,旨在噪声存在时相比纯音频模型提升鲁棒性。然而,它们几乎都忽略了 Lombard 效应(即在噪声环境中为提升语音可懂度而改变说话风格,并影响语音的声学特性与唇部运动)的影响。本文中,我们研究 Lombard 效应对音视觉语音识别的影响。据我们所知,这是首个使用端到端深度架构并在未见说话人上给出结果的此类工作。我们的结果表明,恰当建模 Lombard 语音总是有益的。即便在训练集中加入相对少量的 Lombard 语音,在存在噪声 Lombard 语音的真实场景中的性能也能显著提升。我们还表明,文献中遵循的标准做法(在噪声普通语音上训练并测试模型)能正确估计仅视频性能,并略微低估音视觉性能。对于纯音频方法,在高于 -3dB 的 SNR 下性能被高估,在更低 SNR 下被低估。
引用
@article{arxiv.1906.02112,
title = {Investigating the Lombard Effect Influence on End-to-End Audio-Visual Speech Recognition},
author = {Pingchuan Ma and Stavros Petridis and Maja Pantic},
journal= {arXiv preprint arXiv:1906.02112},
year = {2019}
}
备注
Accepted for publication at Interspeech 2019