中文

用于在线语音识别的多头单调分块注意力

计算与语言 2020-05-04 v1 声音 音频与语音处理

摘要

Listen, Attend and Spell (LAS) 模型的注意力机制需要整个输入序列来计算注意力上下文,因此不适用于在线语音识别。为处理该问题,我们提出多头单调分块注意力 (MTH-MoChA),即 MoChA 的改进版本。MTH-MoChA 将输入序列切分为小块,并在块上计算多头注意力。我们还探索了有用的训练策略,如 LSTM 池化、最小词错率训练和 SpecAugment,以进一步提升 MTH-MoChA 的性能。在 AISHELL-1 数据上的实验表明,所提模型结合训练策略将 MoChA 在测试集上的字符错误率 (CER) 从 8.96% 提升至 7.68%。在另一个 18000 小时车载语音数据集上,MTH-MoChA 取得 7.28% 的 CER,显著优于最先进的混合系统。

关键词

引用

@article{arxiv.2005.00205,
  title  = {Multi-head Monotonic Chunkwise Attention For Online Speech Recognition},
  author = {Baiji Liu and Songjun Cao and Sining Sun and Weibin Zhang and Long Ma},
  journal= {arXiv preprint arXiv:2005.00205},
  year   = {2020}
}