中文

U-SAM:一种用于统一语音、音频和音乐理解的音频语言模型

音频与语音处理 2025-05-28 v3 声音 信号处理

摘要

文本生成范式为音频任务开辟了新的统一音频理解可能性。然而,现有模型在实现对speech、general audio events和music等多样化音频类型的全面理解方面面临重大挑战。此外,它们对齐的独占性依赖于交叉熵损失,往往不足,因为它将所有token相等对待,未能考虑冗余音频特征,导致跨模态对齐较弱。为此,本文引入U-SAM,这是一个先进的音频语言模型,将speech、audio和music的专用编码器与预训练的大语言模型(LLM)集成。U-SAM采用Mixture of Experts(MoE)projector进行task-aware特征融合,动态路由和集成domain-specific编码器的输出。此外,U-SAM包含一个Semantic-Aware Contrastive Loss Module,该模块在语言监督下显式识别冗余音频特征并纠正其语义和频谱表示,以增强跨模态对齐。广泛的实验表明,U-SAM在多个基准测试上 consistently优于专用模型和现有音频语言模型。此外,它在未见任务上展现出涌现能力,凸显了其泛化潜力。代码已公开(https://github.com/Honee-W/U-SAM/)。

关键词

引用

@article{arxiv.2505.13880,
  title  = {U-SAM: An audio language Model for Unified Speech, Audio, and Music Understanding},
  author = {Ziqian Wang and Xianjun Xia and Xinfa Zhu and Lei Xie},
  journal= {arXiv preprint arXiv:2505.13880},
  year   = {2025}
}

备注

Accepted to Interspeech 2025