中文

多流端到端语音识别

音频与语音处理 2019-10-22 v2 计算与语言 声音

摘要

基于注意力的方法与连接主义时序分类(CTC)网络已成为端到端(E2E)自动语音识别(ASR)中富有前景的研究方向。联合 CTC/注意力模型通过在多任务训练与联合解码中利用两种架构取得了巨大成功。在本工作中,我们提出一种基于联合 CTC/注意力 E2E ASR 的多流框架,其并行流由独立编码器表示,旨在捕获多样信息。在常规注意力网络之上,引入分层注意力网络(HAN)以引导解码器关注信息量最大的编码器。为每个流分配独立的 CTC 网络以强制单调对齐。提出并讨论了两种代表性框架,即多编码器多分辨率(MEM-Res)框架与多编码器多阵列(MEM-Array)框架。在 MEM-Res 框架中,两个具有不同架构、时间分辨率和独立 CTC 网络的异构编码器并行工作,从相同声学信号中提取互补信息。实验在 Wall Street Journal(WSJ)与 CHiME-4 上进行,相对词错误率(WER)降低 18.0-32.1%,并在 WSJ eval92 测试集上取得最佳 WER 3.6%。MEM-Array 框架旨在利用多个麦克风阵列(由独立编码器激活)提升远场 ASR 鲁棒性。与最佳单阵列结果相比,所提框架在 AMI 与 DIRHA 多阵列语料上分别取得相对 WER 降低 3.7% 与 9.7%,且优于传统融合策略。

关键词

引用

@article{arxiv.1906.08041,
  title  = {Multi-Stream End-to-End Speech Recognition},
  author = {Ruizhi Li and Xiaofei Wang and Sri Harish Mallidi and Shinji Watanabe and Takaaki Hori and Hynek Hermansky},
  journal= {arXiv preprint arXiv:1906.08041},
  year   = {2019}
}

备注

submitted to IEEE TASLP (In review). arXiv admin note: substantial text overlap with arXiv:1811.04897, arXiv:1811.04903