中文

以失真无关声学建模弥合单通道语音增强与识别间的鸿沟

音频与语音处理 2019-03-14 v2 计算与语言 声音

摘要

自几年前深度学习引入以来,单通道语音增强取得了巨大进展。尽管已证明增强语音对人类听者具有更好的可懂度与质量,但将其直接输入用含噪语音训练的自动语音识别(ASR)系统并未带来预期的 ASR 性能提升。增强在识别上缺乏收益,或单通道语音增强与识别之间的鸿沟,常归因于增强过程中引入的语音失真。在本研究中,我们分析失真问题,比较不同声学模型,并探究一种用于单通道语音识别的失真无关训练方案。实验结果表明,失真无关声学建模能够克服失真问题。此类声学模型也能与训练时所用不同的语音增强模型协同工作。此外,本文所研究的模型在 CHiME-2 语料库上优于先前最佳系统。

关键词

引用

@article{arxiv.1903.04567,
  title  = {Bridging the Gap Between Monaural Speech Enhancement and Recognition with Distortion-Independent Acoustic Modeling},
  author = {Peidong Wang and Ke Tan and DeLiang Wang},
  journal= {arXiv preprint arXiv:1903.04567},
  year   = {2019}
}