SAM:一种基于 Mamba-2 状态空间的音频语言模型
声音
2026-03-06 v2 音频与语音处理
摘要
我们提出了 SAM,一种状态空间音频语言模型,它将音频编码器与 Mamba-2 骨干网络相集成。SAM-2.7B 在 AudioSet 上实现了 21.1 mAP,在 AudioCaps 上实现了 17.6 SPICE,以更少的参数匹配或超越了更大的基于 7B Transformer 的模型。我们进一步提供了关于 SSM 如何与音频编码器输出交互的首次系统性表示级分析:(1) 联合音频编码器微调是必不可少的,这由准确率的提升以及在不同 SSM 规模下观察到的 token 表示秩和相似性的自适应所支持;(2) 尽管具有线性扩展性,但相比于过长的 token 序列,SSM 更受益于紧凑且信息丰富的音频 token 表示;(3) 引入指令遵循监督显著提升了推理能力,将 MMAU-Sound 的准确率从 22.8 提高到了 56.8。通过全面的实验与分析,我们确立了将 SSM 作为强大的、可扩展的音频语言模型骨干网络的实用设计原则。
引用
@article{arxiv.2509.15680,
title = {SAM: A Mamba-2 State-Space Audio-Language Model},
author = {Taehan Lee and Jaehan Jung and Hyukjun Lee},
journal= {arXiv preprint arXiv:2509.15680},
year = {2026}
}
备注
6 pages, Submitted to Interspeech 2026