基于 Conformer 并采用旋转位置嵌入的端到端语音识别
声音
2021-07-14 v1 计算与语言
音频与语音处理
摘要
基于 Transformer 的端到端语音识别模型近年来受到相当关注,因为其训练速度快且能够建模长程全局上下文。Transformer 架构中的位置嵌入是不可或缺的,因为它为输入序列中不同位置元素之间的依赖建模提供了监督。为了利用输入序列的时间顺序,许多工作将元素的相对或绝对位置的一些信息注入到输入序列中。在本工作中,我们研究了卷积增强的 Transformer(conformer)中的各种位置嵌入方法,并采用了一种名为旋转位置嵌入(RoPE)的新颖实现。RoPE 通过旋转矩阵将绝对位置信息编码到输入序列中,然后自然地将显式相对位置信息整合进自注意力模块。为评估 RoPE 方法的有效性,我们在 AISHELL-1 和 LibriSpeech 语料库上进行了实验。结果表明,增强 RoPE 的 conformer 在语音识别任务中取得了优越性能。具体而言,我们的模型在 LibriSpeech 语料库的 test-clean 和 test-other 集上分别相对于 conformer 实现了 8.70% 和 7.27% 的相对词错误率降低。
引用
@article{arxiv.2107.05907,
title = {Conformer-based End-to-end Speech Recognition With Rotary Position Embedding},
author = {Shengqiang Li and Menglong Xu and Xiao-Lei Zhang},
journal= {arXiv preprint arXiv:2107.05907},
year = {2021}
}
备注
5 pages, 3 figures