用于端到端语音识别的自注意力转导器
音频与语音处理
2020-02-25 v1 计算与语言
声音
摘要
循环神经网络转导器(RNN-T)已成功应用于端到端语音识别。然而,其循环结构难以并行化。本文中,我们提出一种用于语音识别的自注意力转导器(SA-T)。RNN 被自注意力块替代,后者善于建模序列内部的长程依赖且能够高效并行。此外,提出一种路径感知正则化以辅助 SA-T 学习对齐并提升性能。另外,利用块流机制实现在线解码。所有实验均在中文数据集 AISHELL-1 上进行。结果表明,相较于基线 RNN-T,我们所提方法在字符错误率上取得了 21.3% 的相对降低。此外,带块流机制的 SA-T 仅以极小的性能下降即可实现在线解码。
引用
@article{arxiv.1909.13037,
title = {Self-Attention Transducers for End-to-End Speech Recognition},
author = {Zhengkun Tian and Jiangyan Yi and Jianhua Tao and Ye Bai and Zhengqi Wen},
journal= {arXiv preprint arXiv:1909.13037},
year = {2020}
}