SSAMBA:基于 Mamba 状态空间模型的自监督音频表征学习
音频与语音处理
2025-02-06 v2 机器学习
摘要
Transformer 因其强大的建模能力,在诸多任务中革新了深度学习,包括音频表征学习。然而,它们常在 GPU 内存使用和计算推理时间上具有二次复杂度,影响效率。最近,类似 Mamba 的状态空间模型 (SSM) 作为更高效的替代方案涌现,因其避免了上述复杂度。鉴于这些优势,我们探索了 SSM 在音频任务中的潜力。本文提出了自监督音频 Mamba (Self-Supervised Audio Mamba, SSAMBA),这是首个面向音频表征学习的、无注意力且基于 SSM 的模型。SSAMBA 利用双向 Mamba 有效捕获复杂音频模式。我们纳入自监督预训练框架,优化判别和生成目标,使模型能够从大规模无标签数据集中学习鲁健的音频表征。我们在各种任务上评估了 SSAMBA,包括音频分类、关键词识别和说话人识别。结果表明,SSAMBA 在大多数任务上均优于自监督音频频谱 Transformer (Self-Supervised Audio Spectrogram Transformer, SSAST)。值得注意的是,SSAMBA 在 tiny 模型规模、输入 token 长度为 22k 时,批处理推理速度约快 92.7%,内存效率提升约 95.4%。这些效率提升结合卓越的性能,凸显了 SSAMBA 架构创新的有效性,使其成为广泛音频处理应用的有力选择。
引用
@article{arxiv.2405.11831,
title = {SSAMBA: Self-Supervised Audio Representation Learning with Mamba State Space Model},
author = {Siavash Shams and Sukru Samet Dindar and Xilin Jiang and Nima Mesgarani},
journal= {arXiv preprint arXiv:2405.11831},
year = {2025}
}
备注
Code at https://github.com/SiavashShams/ssamba