基于混合 H3-Conformer 的高效稳健长语种语音识别
声音
2024-10-08 v1 音频与语音处理
摘要
最近,Conformer 在众多语音识别任务中取得了最先进的性能。然而,基于 Transformer 的模型在处理长语种语音(如讲座)时表现显著下降,因为自注意力机制随输入长度平方增长而变得不可靠。为解决此问题,我们采用一种状态空间模型——Hungry Hungry Hippos(H3)来替换或补充多头自注意力(MHSA)。H3 允许以线性阶复杂度建模长序列。在使用 CSJ 和 LibriSpeech 两个数据集的实验中,我们提出的 H3-Conformer 模型对长语种语音实现了高效稳健的识别。此外,我们提出 H3 与 MHSA 的混合方案,表明在高层使用 H3 而在低层使用 MHSA 可显著提升在线识别性能。我们还研究了在所有层中并行使用 H3 和 MHSA 的方案,取得最佳性能。
引用
@article{arxiv.2410.04159,
title = {Efficient and Robust Long-Form Speech Recognition with Hybrid H3-Conformer},
author = {Tomoki Honda and Shinsuke Sakai and Tatsuya Kawahara},
journal= {arXiv preprint arXiv:2410.04159},
year = {2024}
}
备注
Submitted to InterSpeech2024, Sample code is available at https://github.com/mirrormouse/Hybrid-H3-Conformer