MoWE-Audio:基于混合弱编码器的多任务AudioLLM
声音
2025-04-22 v4 人工智能
计算与语言
音频与语音处理
摘要
大型语言模型(LLM)的快速发展显著增强了自然语言处理能力,推动了AudioLLM的发展,这类模型能够处理和理解语音和音频输入以及文本。现有的AudioLLM通常将预训练音频编码器与预训练LLM组合起来,然后在特定音频任务上进行微调。然而,预训练音频编码器的容量受限,难以捕获新任务和数据集的特征。为此,我们提出将混合weak编码器(MoWE)引入AudioLLM框架。MoWE通过一组相对轻量级的编码器来补充基础编码器,根据音频输入有选择地激活这些编码器,以增强特征提取而不显著增加模型规模。我们的实验结果表明,MoWE有效提高了多任务性能,拓宽了AudioLLM适用于更多样化音频任务的范围。
引用
@article{arxiv.2409.06635,
title = {MoWE-Audio: Multitask AudioLLMs with Mixture of Weak Encoders},
author = {Wenyu Zhang and Shuo Sun and Bin Wang and Xunlong Zou and Zhuohan Liu and Yingxu He and Geyu Lin and Nancy F. Chen and Ai Ti Aw},
journal= {arXiv preprint arXiv:2409.06635},
year = {2025}
}
备注
ICASSP 2025