中文

ASCMamba:用于声学场景分类的多模态时频 Mamba 网络

声音 2025-08-26 v2

摘要

声学场景分类 (Acoustic Scene Classification, ASC) 是计算听力中的一个基础问题,旨在基于环境的独特声学特征进行分类。在 APSIPA ASC 2025 大赛的 ASC 任务中,组织者引入了多模态 ASC 任务。与传统仅依赖音频输入的 ASC 系统不同,此挑战提供了额外的文本信息作为输入,包括音频录制的位置和录制时间。本文我们提出了用于 APSIPA ASC 2025 大赛 ASC 任务的我们方案。具体而言,我们提出了一种多模态网络 ASCMamba,将音频和文本信息整合以进行细粒度的声学场景理解和有效的多模态 ASC。我们提出的 ASCMamba 采用 DenseEncoder 从声谱图中提取层次化的频谱特征,随后采用双路径 Mamba 块使用基于 Mamba 的状态空间模型捕获长程的时间和频率依赖性。此外,我们提出了两步伪标签机制以生成更可靠的伪标签。结果表明,我们提出的系统超越了所有参赛团队,实现了 6.2% 的基线提升。代码、模型和预训练的检查点均可用于 https://github.com/S-Orion/ASCMamba.git。

关键词

引用

@article{arxiv.2508.15632,
  title  = {ASCMamba: Multimodal Time-Frequency Mamba for Acoustic Scene Classification},
  author = {Bochao Sun and Dong Wang and ZhanLong Yang and Jun Yang and Han Yin},
  journal= {arXiv preprint arXiv:2508.15632},
  year   = {2025}
}