中文

基于唇读的深度学习语音增强方法

计算机视觉与模式识别 2018-08-02 v1 机器学习 声音 音频与语音处理

摘要

本文提出了一种新颖的基于唇读的深度学习语音增强框架。与近期发表的仅依赖深度学习的、相对简单的基准方法相比,所提方法利用了深度学习和解析声学建模(基于滤波的方法)的互补优势。所提出的音视频(AV)语音增强框架在两个层级上运作。在第一层级,采用一种新颖的基于深度学习的唇读回归模型。在第二层级,利用增强的视觉派生维纳滤波器(EVWF),将唇读近似的干净音频特征用于干净音频功率谱估计。具体而言,设计了一种基于堆叠长短期记忆(LSTM)的唇读回归模型,仅使用时间视觉特征并考虑不同数量的先前视觉帧来估计干净音频特征。对于干净语音谱估计,提出了一种新的滤波器组域EVWF,其利用了估计的语音特征。使用理想AV映射和LSTM驱动的AV映射,将所提EVWF与传统谱减法和对数最小均方误差方法进行比较。使用基准Grid和ChiME3语料库,在不同的动态真实世界商业场景(如咖啡馆、公共交通、行人区)下、不同信噪比水平(从低到高SNR)评估了所提语音增强框架的潜力。客观测试中,使用语音质量感知评估来评价恢复语音的质量。主观测试中,采用标准平均意见得分法并结合推断统计。对比仿真结果表明,在语音质量和语音可懂度方面均取得了显著的唇读和语音增强改进。

关键词

引用

@article{arxiv.1808.00046,
  title  = {Lip-Reading Driven Deep Learning Approach for Speech Enhancement},
  author = {Ahsan Adeel and Mandar Gogate and Amir Hussain and William M. Whitmer},
  journal= {arXiv preprint arXiv:1808.00046},
  year   = {2018}
}

备注

11 pages, 13 figures