Samba-ASR:基于结构化状态空间模型的先进语音识别
计算与语言
2025-01-09 v3 人工智能
声音
音频与语音处理
摘要
我们提出 Samba ASR,这是首个利用新型 Mamba 架构同时作为编码器和解码器、构建于状态空间模型(SSMs)基础之上的先进自动语音识别(ASR)模型。与依赖自注意力机制来捕获依赖关系的基于 Transformer 的 ASR 模型不同,Samba ASR 通过高效的状态空间动力学有效地建模局部与全局时间依赖关系,取得了显著的性能提升。通过解决 Transformer 的局限性,例如随输入长度呈二次方增长的计算复杂度以及难以处理长程依赖关系,Samba ASR 实现了更高的准确性与效率。实验结果表明,Samba ASR 在多个标准基准上超越了现有的开源基于 Transformer 的 ASR 模型,确立了其作为 ASR 新一代最先进模型的地位。在基准数据集上的广泛评估显示,词错误率(WER)有显著改善,即使在低资源场景下也具有竞争力。此外,Mamba 架构固有的计算效率与参数优化使 Samba ASR 成为适用于多样化 ASR 任务的可扩展且稳健的解决方案。我们的贡献包括:开发了一种用于自动语音识别(ASR)的新型 Samba ASR 架构,展示了结构化状态空间模型(SSMs)在语音序列处理上相对于基于 Transformer 的模型的优越性。我们在公开基准上提供了全面的评估,展示了最先进(SOTA)的性能,并对计算效率、抗噪鲁棒性以及序列泛化能力进行了深入分析。本工作凸显了 Mamba SSM 作为一种无 Transformer 的替代方案,在实现高效且准确的 ASR 方面的可行性。通过利用状态空间建模的进展,Samba ASR 重新定义了 ASR 的性能标准,并为该领域未来研究树立了新的基准。
引用
@article{arxiv.2501.02832,
title = {Samba-ASR: State-Of-The-Art Speech Recognition Leveraging Structured State-Space Models},
author = {Syed Abdul Gaffar Shakhadri and Kruthika KR and Kartik Basavaraj Angadi},
journal= {arXiv preprint arXiv:2501.02832},
year = {2025}
}