中文

基于混合 H3-Conformer 的高效稳健长语种语音识别

声音 2024-10-08 v1 音频与语音处理

摘要

最近,Conformer 在众多语音识别任务中取得了最先进的性能。然而,基于 Transformer 的模型在处理长语种语音(如讲座)时表现显著下降,因为自注意力机制随输入长度平方增长而变得不可靠。为解决此问题,我们采用一种状态空间模型——Hungry Hungry Hippos(H3)来替换或补充多头自注意力(MHSA)。H3 允许以线性阶复杂度建模长序列。在使用 CSJ 和 LibriSpeech 两个数据集的实验中,我们提出的 H3-Conformer 模型对长语种语音实现了高效稳健的识别。此外,我们提出 H3 与 MHSA 的混合方案,表明在高层使用 H3 而在低层使用 MHSA 可显著提升在线识别性能。我们还研究了在所有层中并行使用 H3 和 MHSA 的方案,取得最佳性能。

关键词

引用

@article{arxiv.2410.04159,
  title  = {Efficient and Robust Long-Form Speech Recognition with Hybrid H3-Conformer},
  author = {Tomoki Honda and Shinsuke Sakai and Tatsuya Kawahara},
  journal= {arXiv preprint arXiv:2410.04159},
  year   = {2024}
}

备注

Submitted to InterSpeech2024, Sample code is available at https://github.com/mirrormouse/Hybrid-H3-Conformer