基于Transformer的具有局部密集合成器注意力的端到端语音识别
声音
2021-07-27 v3 计算与语言
音频与语音处理
摘要
近来,若干研究报道点积自注意力(SA)对于最先进的 Transformer 模型可能并非不可或缺。鉴于密集合成器注意力(DSA)摒弃了点积和成对交互,并在许多语言处理任务中取得了有竞争力的结果,本文中我们首先提出一种基于 DSA 的语音识别,作为 SA 的替代方案。为降低计算复杂度并提升性能,我们进一步提出局部 DSA(LDSA),将 DSA 的注意力范围限制在当前中心帧周围的局部范围内用于语音识别。最后,我们将 LDSA 与 SA 结合以同时提取局部和全局信息。在 Ai-shell1 普通话语音识别语料库上的实验结果表明,所提 LDSA-Transformer 取得了 6.49% 的字错误率(CER),略优于 SA-Transformer。同时,LDSA-Transformer 比 SA-Transformer 所需计算更少。所提结合方法不仅取得了 6.18% 的 CER,显著优于 SA-Transformer,而且具有与后者大致相同的参数量和计算复杂度。多头 LDSA 的实现可在 https://github.com/mlxu995/multihead-LDSA 获取。
引用
@article{arxiv.2010.12155,
title = {Transformer-based End-to-End Speech Recognition with Local Dense Synthesizer Attention},
author = {Menglong Xu and Shengqiang Li and Xiao-Lei Zhang},
journal= {arXiv preprint arXiv:2010.12155},
year = {2021}
}
备注
5 pages, 3 figures