用于基于 Transformer 的端到端语音识别的简化自注意力机制
声音
2020-11-18 v2 计算与语言
音频与语音处理
摘要
Transformer 模型已被引入端到端语音识别,因其在建模长期依赖方面的优越性而在多项任务上取得最优性能。然而,此类改进通常通过使用非常大的神经网络获得。Transformer 模型主要包括两个子模块——位置前馈层和自注意力(SAN)层。在本文中,为降低模型复杂度同时保持良好性能,我们提出一种简化自注意力(SSAN)层,其采用 FSMN 记忆块代替投影层来形成基于 Transformer 的端到端语音识别的查询和键向量。我们在公开的 AISHELL-1、内部 1000 小时和 20000 小时大规模普通话任务上评估了基于 SSAN 和常规 SAN 的 Transformer。结果表明,我们提出的基于 SSAN 的 Transformer 模型在 AISHELL-1 任务上可实现超过 20% 的模型参数量相对减少和 6.7% 的相对 CER 降低。在令人印象深刻的 20% 参数量减少下,我们的模型在 20000 小时大规模任务上未表现出识别性能损失。
引用
@article{arxiv.2005.10463,
title = {Simplified Self-Attention for Transformer-based End-to-End Speech Recognition},
author = {Haoneng Luo and Shiliang Zhang and Ming Lei and Lei Xie},
journal= {arXiv preprint arXiv:2005.10463},
year = {2020}
}
备注
Accepted to SLT 2021