Squeezeformer:一种用于自动语音识别的高效 Transformer
音频与语音处理
2022-10-18 v2 计算与语言
声音
摘要
近来提出的 Conformer 模型因其捕获局部与全局特征的混合注意力-卷积架构,已成为各类下游语音任务的事实骨干模型。然而,通过一系列系统性研究,我们发现 Conformer 架构的设计选择并非最优。在重新审视 Conformer 的宏架构与微架构设计选择后,我们提出了 Squeezeformer,其在相同训练方案下一致优于最先进的 ASR 模型。具体而言,对于宏架构,Squeezeformer 引入了(i)Temporal U-Net 结构,降低了多头注意力模块在长序列上的开销;(ii)更简单的块结构,即多头注意力或卷积模块后接前馈模块,而非 Conformer 中提出的 Macaron 结构。此外,对于微架构,Squeezeformer(i)简化了卷积块中的激活函数,(ii)移除了冗余的层归一化操作,(iii)引入了高效的深度可分离下采样层以高效地对输入信号进行子采样。Squeezeformer 在无需外部语言模型的 LibriSpeech test-other 上取得了 7.5%、6.5% 和 6.0% 的词错误率(WER)的 SOTA 结果,比同等 FLOPs 数的 Conformer-CTC 分别好 3.1%、1.4% 和 0.6%。我们的代码已开源并可在线获取。
引用
@article{arxiv.2206.00888,
title = {Squeezeformer: An Efficient Transformer for Automatic Speech Recognition},
author = {Sehoon Kim and Amir Gholami and Albert Shaw and Nicholas Lee and Karttikeya Mangalam and Jitendra Malik and Michael W. Mahoney and Kurt Keutzer},
journal= {arXiv preprint arXiv:2206.00888},
year = {2022}
}
备注
NeurIPS 2022