中文

Audio Mamba:用于音频标记的预训练音频状态空间模型

声音 2024-05-24 v1 人工智能 音频与语音处理

摘要

音频标记是将音频样本映射到其相应类别的重要任务。最近利用变换器模型在该领域取得了很大成功。然而,二次自注意力成本限制了音频变换器模型的规模扩展,并进一步约束了更通用音频模型的发展。在本文中,我们通过提出 Audio Mamba 来解决此问题,这是一种无自注意力的方法,可利用状态空间模型捕获长音频频谱依赖性。我们在两个音频标记数据集上的实验结果表明,Audio Mamba 在参数效率方面具有优势,仅使用三分之一参数即可实现与最先进 (SOTA) 音频频谱变换器相当的效果。

关键词

引用

@article{arxiv.2405.13636,
  title  = {Audio Mamba: Pretrained Audio State Space Model For Audio Tagging},
  author = {Jiaju Lin and Haoxuan Hu},
  journal= {arXiv preprint arXiv:2405.13636},
  year   = {2024}
}