中文

远场自动语音识别

音频与语音处理 2020-09-22 v1

摘要

对距麦克风一定距离处所说语音的机器识别,称为远场自动语音识别(ASR),在科学界与工业界受到了显著增长的关注,这导致或是由同样显著的识别准确率提升所引起。同时,它已凭借具有语音接口的数字家庭助手进入消费市场,成为其最突出的应用。在距离处记录的语音受到各种声学失真的影响,因此与近讲语音的 ASR 相比,出现了相当不同的处理流程。采用用于去混响、源分离和声学波束形成的信号增强前端来清理语音,而后端 ASR 引擎通过多条件训练和自适应变得鲁棒。我们还将描述所谓的 ASR 端到端方法,这是一种新的有前景的架构,最近已被扩展到远场场景。本教程文章记述了用于实现准确远距离语音识别的算法,并且将看到,尽管深度学习在技术突破中占有重要份额,但与传统的信号处理巧妙结合可以带来令人惊讶的有效解决方案。

关键词

引用

@article{arxiv.2009.09395,
  title  = {Far-Field Automatic Speech Recognition},
  author = {Reinhold Haeb-Umbach and Jahn Heymann and Lukas Drude and Shinji Watanabe and Marc Delcroix and Tomohiro Nakatani},
  journal= {arXiv preprint arXiv:2009.09395},
  year   = {2020}
}

备注

accepted for Proceedings of the IEEE