Mamba 在语音自监督模型中的探索
计算与语言
2026-04-21 v2 人工智能
摘要
尽管 Mamba 在语言建模中已展现出强劲性能,但其作为语音自监督学习(SSL)模型的潜力仍未得到充分探索,此前研究仅限于孤立任务。为解决这一问题,我们探索了基于 Mamba 的 HuBERT 模型作为 Transformer 基础 SSL 架构的替代方案。利用线性时间的选择性状态空间,这些模型能够在显著降低计算量的情况下对长上下文 ASR 进行微调。此外,它们在针对流式 ASR 进行微调时展现出更优的性能。除微调外,这些模型在 SUPERB 探测基准测试中表现出具有竞争力的性能,特别是在因果设置下。我们的分析表明,它们产生了更高质量的量化表征,并且比基于 Transformer 的模型更清晰地捕捉说话人相关特征。这些发现强调了基于 Mamba 的 SSL 作为长序列建模、实时语音建模和语音单元提取的一个有前景且互补的方向。代码库位于 https://github.com/hckuo145/Mamba-based-HuBERT。
引用
@article{arxiv.2506.12606,
title = {An Exploration of Mamba for Speech Self-Supervised Models},
author = {Tzu-Quan Lin and Heng-Cheng Kuo and Tzu-Chieh Wei and Hsi-Chun Cheng and Chun Wei Chen and Hsien-Fu Hsiao and Yu Tsao and Hung-yi Lee},
journal= {arXiv preprint arXiv:2506.12606},
year = {2026}
}
备注
Accepted at ACL 2026 Main Conference