Speech-Mamba:基于选择性状态空间模型的长上下文语音识别
音频与语音处理
2024-09-30 v1 声音
摘要
由于基于 Transformer 的模型具有较高的二次复杂度,当前的自动语音识别系统在建模长语音序列方面存在困难。诸如 Mamba 的选择性状态空间模型在自然语言处理和计算机视觉任务的长序列建模中表现良好。然而,在语音技术任务中的研究探索尚不充分。我们提出了 Speech-Mamba,它在 Transformer 神经架构中引入了选择性状态空间建模。Speech-Mamba 中基于选择性状态空间模型的长序列表示,得到了基于 Transformer 建模的低层表示的补充。Speech-Mamba 实现了更好的建模长程依赖的能力,因为它随序列长度呈近线性扩展。
引用
@article{arxiv.2409.18654,
title = {Speech-Mamba: Long-Context Speech Recognition with Selective State Spaces Models},
author = {Xiaoxue Gao and Nancy F. Chen},
journal= {arXiv preprint arXiv:2409.18654},
year = {2024}
}
备注
8 pages; SLT 2024