Lombard反射对基于深度学习的音视频语音增强系统性能的影响
音频与语音处理
2019-11-05 v1 机器学习
声音
图像与视频处理
摘要
人类当置身于噪声环境中时往往会改变其说话方式,这一反射被称为Lombard效应。当前基于深度学习的语音增强系统通常未考虑这种说话风格的变化,因为它们是在安静条件下录制的自然(非Lombard)语音语句上训练的,并人为添加噪声。在本文中,我们研究了Lombard反射对基于深度学习的音视频语音增强系统性能的影响。结果表明,在自然语音上训练的系统与在Lombard语音上训练的系统之间存在高达约5 dB的性能差距。这表明在音视频语音增强系统的设计中考虑自然与Lombard语音间不匹配的好处。
引用
@article{arxiv.1811.06250,
title = {Effects of Lombard Reflex on the Performance of Deep-Learning-Based Audio-Visual Speech Enhancement Systems},
author = {Daniel Michelsanti and Zheng-Hua Tan and Sigurdur Sigurdsson and Jesper Jensen},
journal= {arXiv preprint arXiv:1811.06250},
year = {2019}
}