用于端到端语音识别的多编码器多分辨率框架
计算与语言
2018-11-13 v1
摘要
基于注意力的方法与连接时序分类(Connectionist Temporal Classification, CTC)网络已成为端到端自动语音识别(Automatic Speech Recognition, ASR)中颇有前景的研究方向。联合 CTC/注意力模型通过在多任务训练与联合解码中利用两种架构取得了巨大成功。本工作中,我们提出了一种基于联合 CTC/注意力模型的新型多编码器多分辨率(Multi-Encoder Multi-Resolution, MEMR)框架。两个具有不同架构、时间分辨率和独立 CTC 网络的异构编码器并行工作以提取互补的声学信息。随后采用分层注意力机制融合编码器层级的信息。为证明所提模型的有效性,我们在 Wall Street Journal (WSJ) 和 CHiME-4 上进行了实验,取得了 18.0-32.1% 的相对词错率(Word Error Rate, WER)下降。此外,所提 MEMR 模型在 WSJ eval92 测试集上取得了 3.6% 的 WER,这是该基准上端到端系统所报道的最佳 WER。
引用
@article{arxiv.1811.04897,
title = {Multi-encoder multi-resolution framework for end-to-end speech recognition},
author = {Ruizhi Li and Xiaofei Wang and Sri Harish Mallidi and Takaaki Hori and Shinji Watanabe and Hynek Hermansky},
journal= {arXiv preprint arXiv:1811.04897},
year = {2018}
}