HYBRIDFORMER:通过混合注意力与NSR机制改进SqueezeFormer
音频与语音处理
2023-03-16 v1 声音
摘要
SqueezeFormer近期在自动语音识别(ASR)中展现出令人印象深刻的性能。然而,其推理速度受限于softmax注意力(SA)的二次复杂度。此外,受限于较大的卷积核尺寸,SqueezeFormer的局部建模能力不充分。本文中,我们提出一种新方法HybridFormer,以快速高效的方式改进SqueezeFormer。具体而言,我们首先引入线性注意力(LA)并提出一种混合LASA范式以提高模型的推理速度。其次,提出一种由混合神经架构搜索(NAS)引导的结构重参数化(SRep)机制,称为NSR,以增强模型提取局部交互的能力。在LibriSpeech数据集上进行的广泛实验表明,我们提出的HybridFormer在test-other数据集上相较SqueezeFormer可实现9.1%的相对词错误率(WER)降低。此外,当输入语音为30s时,HybridFormer可将模型推理速度提升高达18%。我们的源代码已在线公开。
引用
@article{arxiv.2303.08636,
title = {HYBRIDFORMER: improving SqueezeFormer with hybrid attention and NSR mechanism},
author = {Yuguang Yang and Yu Pan and Jingjing Yin and Jiangyu Han and Lei Ma and Heng Lu},
journal= {arXiv preprint arXiv:2303.08636},
year = {2023}
}
备注
Accepted by ICASSP2023