基于流注意力的多阵列端到端语音识别
计算与语言
2019-02-20 v2 声音
音频与语音处理
摘要
使用多个麦克风阵列的自动语音识别(ASR)在远场鲁棒性方面取得了巨大成功。在此任务中,利用每个阵列共享并贡献的全部信息至关重要。受联合连接主义时序分类(CTC)/注意力机制在端到端(E2E)ASR 中进展的启发,本文提出了一种基于流注意力的多阵列框架。麦克风阵列作为信息流,由独立编码器激活,并在 CTC 与注意力网络共同指导下解码。在注意力方面,采用了层次化结构。在常规注意力网络之上,引入流注意力以引导解码器偏向最具信息量的编码器。实验在使用编码器-解码器架构的 AMI 和 DIRHA 多阵列语料库上进行。与最佳单阵列结果相比,所提框架在两个数据集上分别实现了 3.7% 和 9.7% 的相对词错误率(WER)降低,优于传统策略。
引用
@article{arxiv.1811.04903,
title = {Stream attention-based multi-array end-to-end speech recognition},
author = {Xiaofei Wang and Ruizhi Li and Sri Harish Mallid and Takaaki Hori and Shinji Watanabe and Hynek Hermansky},
journal= {arXiv preprint arXiv:1811.04903},
year = {2019}
}
备注
Submitted to ICASSP 2019