SRU++:开创结合注意力的快速递归用于语音识别
音频与语音处理
2021-10-13 v1 计算与语言
摘要
Transformer 架构因其注意力机制擅长捕捉长程依赖,已被广泛采纳为大多数序列转导任务(包括自动语音识别(ASR))的主导架构。虽然纯注意力构建的模型比常规 RNN 更易并行化,但一种新颖的网络架构 SRU++ 最近被提出。通过结合快速递归与注意力机制,SRU++ 在序列建模中展现出强大能力,并以更高的计算效率在各种语言建模与机器翻译任务中取得接近最优的结果。在本工作中,我们通过跨多个 ASR 基准与 Conformer 比较,展示了在 ASR 任务中应用 SRU++ 的优势,并研究这些优势如何推广到长格式语音输入。在流行的 LibriSpeech 基准上,我们的 SRU++ 模型在 test-clean / test-other 上取得 2.0% / 4.7% 的 WER,在相同设置下与最优的 Conformer 编码器相比具有竞争力。具体而言,基于我们的分析,SRU++ 在长格式语音输入上能以较大优势超越 Conformer。
引用
@article{arxiv.2110.05571,
title = {SRU++: Pioneering Fast Recurrence with Attention for Speech Recognition},
author = {Jing Pan and Tao Lei and Kwangyoun Kim and Kyu Han and Shinji Watanabe},
journal= {arXiv preprint arXiv:2110.05571},
year = {2021}
}