中文

Audio Mamba:用于自监督音频表示的选择性状态空间模型

声音 2024-06-11 v2 人工智能 音频与语音处理

摘要

尽管Transformer作为突出的神经架构被广泛采用,但它也催生了几条独立的研究路线来解决其局限性。其中一种方法是选择性状态空间模型,该模型在语言建模方面已显示出有希望的结果。然而,它们在学习自监督、通用音频表示方面的可行性尚待研究。本文提出了Audio Mamba,一种选择性状态空间模型,用于通过自监督从随机掩蔽的频谱图块中学习通用音频表示。在十个不同的音频识别下游任务上的实证结果表明,所提出的模型在AudioSet数据集上预训练后,在数据集大小、序列长度和模型大小比较中,持续且显著地优于可比较的自监督音频频谱图变换器基线。

关键词

引用

@article{arxiv.2406.02178,
  title  = {Audio Mamba: Selective State Spaces for Self-Supervised Audio Representations},
  author = {Sarthak Yadav and Zheng-Hua Tan},
  journal= {arXiv preprint arXiv:2406.02178},
  year   = {2024}
}

备注

Accepted at INTERSPEECH 2024