中文

Audio Mamba:基于双向状态空间模型的音频表示学习

声音 2024-06-06 v1 人工智能 音频与语音处理

摘要

Transformer 已迅速成为音频分类任务的首选方法,优于基于 CNN 的方法。然而,音频光谱 Transformer (AST) 因自注意力机制呈现二次方尺度。消除这种二次方自注意力成本已成为具有吸引力的研究方向。最近,诸如 Mamba 等状态空间模型 (SSM) 在语言和视觉任务中展现出潜力。本研究探讨了对于音频分类任务,是否必需依赖自注意力机制。我们引入 Audio Mamba (AuM),即首个无自注意力、纯粹基于 SSM 的音频分类模型,以此回答此问题。在六个不同基准数据集上进行评估,AuM 的表现与一些 well-established 的 AST 模型相当或更优。

关键词

引用

@article{arxiv.2406.03344,
  title  = {Audio Mamba: Bidirectional State Space Model for Audio Representation Learning},
  author = {Mehmet Hamza Erol and Arda Senocak and Jiu Feng and Joon Son Chung},
  journal= {arXiv preprint arXiv:2406.03344},
  year   = {2024}
}

备注

Code is available at https://github.com/mhamzaerol/Audio-Mamba-AuM