高效 Conformer:用于自动语音识别的渐进下采样与分组注意力
音频与语音处理
2021-09-09 v2 人工智能
计算与语言
声音
摘要
近期提出的 Conformer 架构通过结合卷积与注意力来建模局部与全局依赖,在自动语音识别中展现了最先进的性能。本文中,我们研究如何在有限计算预算下降低 Conformer 架构复杂度,从而得到一种更高效的架构设计,称之为 Efficient Conformer。我们向 Conformer 编码器引入渐进下采样,并提出一种名为分组注意力的新颖注意力机制,使得对于序列长度 、隐藏维度 和组大小参数 ,可将注意力复杂度从 降至 。我们也实验了使用跨步多头自注意力作为全局下采样操作。我们的实验在 LibriSpeech 数据集上使用 CTC 与 RNN-Transducer 损失进行。我们表明在相同计算预算内,所提架构相较 Conformer 取得了更优性能及更快的训练与解码。我们 1300 万参数的 CTC 模型在 test-clean/test-other 集上无需语言模型即达到 3.6%/9.0% 的竞争性 WER,使用外部 n-gram 语言模型达 2.7%/6.7%,同时在推理时比我们的 CTC Conformer 基线快 29%,训练快 36%。
引用
@article{arxiv.2109.01163,
title = {Efficient conformer: Progressive downsampling and grouped attention for automatic speech recognition},
author = {Maxime Burchi and Valentin Vielzeuf},
journal= {arXiv preprint arXiv:2109.01163},
year = {2021}
}