中文

面向远场语音识别的大感受野卷积网络分析

音频与语音处理 2019-10-17 v1 机器学习 声音 机器学习

摘要

尽管过去几年为构建适用于不同声学环境的鲁棒自动语音识别(ASR)系统付出了巨大努力,当前最先进技术在嘈杂混响环境中的性能仍显著下降。卷积神经网络(CNN)已成功用于在许多语音处理应用中取得实质性改进,包括远场语音识别(DSR)。然而,标准 CNN 架构在捕捉对设计鲁棒 DSR 系统至关重要的长时语音动态方面效率不高。在本研究中,我们通过研究大感受野 CNN(LRF-CNN)的变体来解决这一问题,这些变体包括深度递归网络、空洞卷积神经网络和堆叠沙漏网络。为比较上述架构与标准 CNN 在华尔街日报(WSJ)语料库上的效能,我们使用基于 DNN-HMM 混合的语音识别系统。我们扩展研究,评估系统在使用真实房间脉冲响应(RIR)模拟的远场语音上的性能。实验表明,在所有架构参数数量固定的情况下,大感受野网络在远场语音上相比标准 CNN 表现出一致的改进。在所探索的 LRF-CNN 中,堆叠沙漏网络相比标准 CNN,在远场模拟语音信号上实现了 8.9% 的词错误率(WER)相对降低和 10.7% 的帧准确率相对提升。

关键词

引用

@article{arxiv.1910.07047,
  title  = {Analyzing Large Receptive Field Convolutional Networks for Distant Speech Recognition},
  author = {Salar Jafarlou and Soheil Khorram and Vinay Kothapally and John H. L. Hansen},
  journal= {arXiv preprint arXiv:1910.07047},
  year   = {2019}
}

备注

ASRU 2019