面向真实环境语音增强的上下文视听切换方法
计算机视觉与模式识别
2019-09-24 v1 声音
音频与语音处理
摘要
人类语音处理本质上是多模态的,其中视觉线索(唇部运动)有助于在噪声中更好地理解语音。在低信噪比(SNR)下,唇读驱动的语音增强显著优于基准的纯音频方法。然而,在高 SNR 或低背景噪声水平下,视觉线索对语音增强变得相当低效。因此,需要一种更优的、上下文感知的视听(AV)系统,能够依据上下文利用视觉与含噪音频特征,并有效应对不同的噪声条件。本文引入一种新颖的上下文 AV 切换组件,针对不同运行条件上下文地利用 AV 线索来估计干净音频,且无需任何 SNR 估计。该切换模块分别在低、高和中等 SNR 水平下切换至纯视觉(V-only)、纯音频(A-only)以及 AV 双线索模式。该上下文 AV 切换组件通过集成卷积神经网络与长短期记忆网络构建。测试时,所开发的新型增强视觉派生维纳滤波器利用估计的干净音频特征进行干净音频功率谱估计。该上下文 AV 语音增强方法在真实场景中使用基准 Grid 与 ChiME3 语料库进行评估。客观测试采用语音质量感知评估来评价恢复语音的质量;主观测试采用标准平均意见得分法。批判性分析与对比研究表明,所提出的上下文 AV 方法在低和高 SNR 下均优于 A-only、V-only、谱减法以及基于对数最小均方误差的语音增强方法,揭示了其在任意真实噪声条件下处理谱-时变的能力。
引用
@article{arxiv.1808.09825,
title = {Contextual Audio-Visual Switching For Speech Enhancement in Real-World Environments},
author = {Ahsan Adeel and Mandar Gogate and Amir Hussain},
journal= {arXiv preprint arXiv:1808.09825},
year = {2019}
}
备注
16 pages, 7 figures. arXiv admin note: substantial text overlap with arXiv:1808.00046