使用多模态大语言模型扩展音频-文本检索
声音
2026-02-23 v1
摘要
音频-文本检索对于构建声学信号与自然语言之间的桥梁至关重要。虽然基于对比双编码器架构(如 CLAP)的模型在此方面取得了显著进展,但其本质上受限于小规模编码器的容量。具体而言,文本编码器难以理解需要推理或世界知识的复杂查询。为此,本文提出 AuroLA 框架,一种新的对比式语言-音频预训练方法,将多模态大语言模型(MLLM)重新用于检索任务。具体做法包括:(i)构建可扩展的数据管道,从多个数据源筛选多样化音频并通过自动标注生成多粒度描述,从长篇描述到结构化标签不等;(ii)改造 MLLM 以检索任务为目的,通过提示它总结音频/文本输入,并使用特殊标记的隐藏状态作为音频/文本嵌入;(iii)设计基于 MLLM 的双向重排模块,通过深度跨模态交互细化检索候选。大量实验表明,AuroLA 在各种基准上均显著优于最先进的模型,包括最新的 PE-AV,而所需训练数据仅为其约 1%。最后,我们观察到数据规模和模型容量之间存在明确的扩展趋势,验证了将 MLLM 作为统一底层架构用于音频-文本检索的有效性。代码已公开于 https://github.com/Jazzcharles/AuroLA。
引用
@article{arxiv.2602.18010,
title = {Scaling Audio-Text Retrieval with Multimodal Large Language Models},
author = {Jilan Xu and Carl Thomé and Danijela Horak and Weidi Xie and Andrew Zisserman},
journal= {arXiv preprint arXiv:2602.18010},
year = {2026}
}
备注
Technical Report