中文

用于远场语音识别的深度学习

计算与语言 2017-12-19 v1 声音 音频与语音处理

摘要

深度学习是一项新兴技术,被认为是最有希望达到更高水平人工智能的方向之一。在其他成就之中,构建能理解语音的计算机代表着迈向智能机器的关键飞跃。然而,尽管过去几十年付出了巨大努力,自然且鲁棒的人机语音交互似乎仍遥不可及,尤其是当用户在噪声与混响环境中通过远距离麦克风进行交互时。后者的干扰严重损害语音信号的可懂度,使得远场语音识别(DSR)成为该领域的主要开放挑战之一。本论文针对后一场景,提出一些新技术、架构与算法,以提升远讲声学模型的鲁棒性。我们首先阐述用于真实数据污染的方法论,特别关注使用模拟数据训练 DNN。接着我们研究更好地利用语音上下文的方法,针对前馈与循环神经网络提出一些原创方法论。最后,受不同 DNN 间协作可能是抵消噪声与混响有害效应关键这一想法的启发,我们提出一种称为深度神经网络网络(network of deep neural networks)的新型深度学习范式。对原始概念的分析基于在真实与模拟数据上开展的广泛实验验证,考虑了不同语料库、麦克风配置、环境、噪声条件与 ASR 任务。

关键词

引用

@article{arxiv.1712.06086,
  title  = {Deep Learning for Distant Speech Recognition},
  author = {Mirco Ravanelli},
  journal= {arXiv preprint arXiv:1712.06086},
  year   = {2017}
}

备注

PhD Thesis Unitn, 2017