中文

用于基于 Transformer 的端到端语音识别的简化自注意力机制

声音 2020-11-18 v2 计算与语言 音频与语音处理

摘要

Transformer 模型已被引入端到端语音识别,因其在建模长期依赖方面的优越性而在多项任务上取得最优性能。然而,此类改进通常通过使用非常大的神经网络获得。Transformer 模型主要包括两个子模块——位置前馈层和自注意力(SAN)层。在本文中,为降低模型复杂度同时保持良好性能,我们提出一种简化自注意力(SSAN)层,其采用 FSMN 记忆块代替投影层来形成基于 Transformer 的端到端语音识别的查询和键向量。我们在公开的 AISHELL-1、内部 1000 小时和 20000 小时大规模普通话任务上评估了基于 SSAN 和常规 SAN 的 Transformer。结果表明,我们提出的基于 SSAN 的 Transformer 模型在 AISHELL-1 任务上可实现超过 20% 的模型参数量相对减少和 6.7% 的相对 CER 降低。在令人印象深刻的 20% 参数量减少下,我们的模型在 20000 小时大规模任务上未表现出识别性能损失。

关键词

引用

@article{arxiv.2005.10463,
  title  = {Simplified Self-Attention for Transformer-based End-to-End Speech Recognition},
  author = {Haoneng Luo and Shiliang Zhang and Ming Lei and Lei Xie},
  journal= {arXiv preprint arXiv:2005.10463},
  year   = {2020}
}

备注

Accepted to SLT 2021