中文

用结构化状态空间序列模型增强 Conformer 以用于在线语音识别

计算与语言 2023-12-29 v2 声音 音频与语音处理

摘要

在线语音识别中模型仅能访问左侧上下文,是 ASR 系统一个重要且具有挑战性的应用场景。在本工作中,我们通过引入结构化状态空间序列模型(S4,一类能以参数高效方式访问任意长左侧上下文的模型)来增强用于在线 ASR 的神经编码器。我们进行了系统的消融研究以比较 S4 模型的变体,并提出了两种将其与卷积结合的新方法。我们发现最有效的设计是用具有实值循环权重的较小 S4 与局部卷积堆叠,使二者互补工作。我们的最佳模型在 Librispeech 的测试集上取得了 4.01%/8.53% 的 WER,优于经过精细调参卷积的 Conformer。

关键词

引用

@article{arxiv.2309.08551,
  title  = {Augmenting conformers with structured state-space sequence models for online speech recognition},
  author = {Haozhe Shan and Albert Gu and Zhong Meng and Weiran Wang and Krzysztof Choromanski and Tara Sainath},
  journal= {arXiv preprint arXiv:2309.08551},
  year   = {2023}
}

备注

ICASSP 2024