大型音频语言模型的MoE适配器:稀疏性、解耦与无梯度冲突
声音
2026-01-09 v2 人工智能
音频与语音处理
摘要
将大型语言模型(LLM)的输入模态扩展到音频域对于实现全面多模态感知至关重要。然而,声学信息本质上是内在异构的,缠绕了语音、音乐和环境背景等属性。现有研究仅使用稠密、参数共享的适配器来建模这些多样化模式,导致优化期间出现梯度冲突,因为针对不同属性所需的参数更新相互矛盾。为此,我们引入了MoE适配器,一种稀疏混合专家(MoE)架构,旨在解耦声学信息。具体而言,它采用动态门控机制将音频标记路由到捕获互补特征子空间的专用专家,同时保留共享专家以获取全局上下文,从而缓解梯度冲突并实现细粒度特征学习。广泛的实验表明,MoE适配器在音频语义和para linguistic 任务上均表现出优越性能, consistently 超过与密集线性基线相当的计算成本。此外,我们将发布相关代码和模型以促进未来研究。
引用
@article{arxiv.2601.02967,
title = {MoE Adapter for Large Audio Language Models: Sparsity, Disentanglement, and Gradient-Conflict-Free},
author = {Yishu Lei and Shuwei He and Jing Hu and Dan Zhang and Xianlong Luo and Danxiang Zhu and Shikun Feng and Rui Liu and Jingzhou He and Yu Sun and Hua Wu and Haifeng Wang},
journal= {arXiv preprint arXiv:2601.02967},
year = {2026}
}
备注
13 pages, 5 figures