SAN-M:配备记忆机制的自注意力用于端到端语音识别
声音
2020-06-03 v1 音频与语音处理
摘要
端到端语音识别近年来变得流行,因为它可以将声学、发音和语言模型集成到单个神经网络中。在端到端方法中,基于注意力的方法已显现出优越性。例如,采用编码器-解码器架构的 Transformer。Transformer 引入的关键改进是利用自注意力取代循环机制,使编码器和解码器能够以更低的计算复杂度捕捉长程依赖。在本工作中,我们提出用 DFSMN 记忆块增强自注意力能力,形成所提出的配备记忆的自注意力(SAN-M)机制。我们进行了理论与实证比较,以证明自注意力与 DFSMN 记忆块之间的相关性与互补性。此外,所提出的 SAN-M 提供了一种高效机制来集成这两个模块。我们在公开 AISHELL-1 基准和一个工业级 20000 小时普通话语音识别任务上评估了我们的方法。在两项任务上,SAN-M 系统均比基于自注意力的 Transformer 基线系统取得了好得多的性能。特别地,即使在未使用任何外部 LM 的情况下,它也能在 AISHELL-1 任务上达到 6.46% 的 CER,轻松优于其他最先进系统。
引用
@article{arxiv.2006.01713,
title = {SAN-M: Memory Equipped Self-Attention for End-to-End Speech Recognition},
author = {Zhifu Gao and Shiliang Zhang and Ming Lei and Ian McLoughlin},
journal= {arXiv preprint arXiv:2006.01713},
year = {2020}
}
备注
submitted to INTERSPEECH2020