Audio Mamba:用于音频标记的预训练音频状态空间模型
声音
2024-05-24 v1 人工智能
音频与语音处理
摘要
音频标记是将音频样本映射到其相应类别的重要任务。最近利用变换器模型在该领域取得了很大成功。然而,二次自注意力成本限制了音频变换器模型的规模扩展,并进一步约束了更通用音频模型的发展。在本文中,我们通过提出 Audio Mamba 来解决此问题,这是一种无自注意力的方法,可利用状态空间模型捕获长音频频谱依赖性。我们在两个音频标记数据集上的实验结果表明,Audio Mamba 在参数效率方面具有优势,仅使用三分之一参数即可实现与最先进 (SOTA) 音频频谱变换器相当的效果。
引用
@article{arxiv.2405.13636,
title = {Audio Mamba: Pretrained Audio State Space Model For Audio Tagging},
author = {Jiaju Lin and Haoxuan Hu},
journal= {arXiv preprint arXiv:2405.13636},
year = {2024}
}