Audio Mamba:基于双向状态空间模型的音频表示学习
声音
2024-06-06 v1 人工智能
音频与语音处理
摘要
Transformer 已迅速成为音频分类任务的首选方法,优于基于 CNN 的方法。然而,音频光谱 Transformer (AST) 因自注意力机制呈现二次方尺度。消除这种二次方自注意力成本已成为具有吸引力的研究方向。最近,诸如 Mamba 等状态空间模型 (SSM) 在语言和视觉任务中展现出潜力。本研究探讨了对于音频分类任务,是否必需依赖自注意力机制。我们引入 Audio Mamba (AuM),即首个无自注意力、纯粹基于 SSM 的音频分类模型,以此回答此问题。在六个不同基准数据集上进行评估,AuM 的表现与一些 well-established 的 AST 模型相当或更优。
引用
@article{arxiv.2406.03344,
title = {Audio Mamba: Bidirectional State Space Model for Audio Representation Learning},
author = {Mehmet Hamza Erol and Arda Senocak and Jiu Feng and Joon Son Chung},
journal= {arXiv preprint arXiv:2406.03344},
year = {2024}
}
备注
Code is available at https://github.com/mhamzaerol/Audio-Mamba-AuM