MATS:纯文本监督下的音频语言模型
声音
2026-01-15 v3 音频与语音处理
摘要
建立在强大的大型语言模型(LLM)之上的大型音频语言模型(LALM)展现出了卓越的音频理解与推理能力。然而,LALM 的训练需要大量的音频-语言对语料库,这在数据收集和训练资源方面都需要巨大的成本。在本文中,我们提出了 \textbf{MATS},一种旨在仅使用纯文本监督处理多音频任务的音频-语言多模态 LLM。通过利用诸如 CLAP 等预训练的音频-语言对齐模型,我们开发了一种纯文本训练策略,将共享的音频-语言潜在空间投影到 LLM 潜在空间中,使 LLM 在训练期间无需依赖音频数据即可具备音频理解能力。为了进一步弥合 CLAP 中音频与语言嵌入之间的模态差距,我们提出了强相关含噪音频文本(Santa)机制。Santa 将音频嵌入映射到 CLAP 语言嵌入空间,同时保留音频输入中的基本信息。大量实验表明,尽管 MATS 仅在文本数据上进行训练,但与在大型音频-语言对上训练的近期 LALM 相比,取得了具有竞争力的性能。代码已在 \href{https://github.com/wangwen-banban/MATS}{https://github.com/wangwen-banban/MATS} 公开。
引用
@article{arxiv.2502.13433,
title = {MATS: An Audio Language Model under Text-only Supervision},
author = {Wen Wang and Ruibing Hou and Hong Chang and Shiguang Shan and Xilin Chen},
journal= {arXiv preprint arXiv:2502.13433},
year = {2026}
}
备注
Accepted by ICML2025