Omni-Embed-Audio:利用多模态大语言模型实现稳健音频-文本检索
声音
2026-04-21 v1 计算与语言
摘要
基于对比语言-音频预训练(CLAP)的音频-文本检索系统在传统基准测试上取得强烈表现;然而,这些基准测试依赖于与实际搜索行为差异巨大的标题式查询,限制了其对实际检索鲁棒性的评估。我们提出Omni-Embed-Audio(OEA),一种利用具备原生音频理解能力的多模态大语言模型构建的检索导向编码器。为系统性评估超越标题式查询的鲁棒性,我们引入用户意图查询(UIQs)——五种反映自然搜索行为的查询形式:问题、命令、关键词标签、改写版本以及排除型负查询。对于负查询,我们开发了困难负样本挖掘管道,提出判别性指标(HNSR、TFR),评估模型抑制声学相似干扰项的能力。在AudioCaps、Clotho和MECAT上进行实验,结果显示OEA在文本到音频检索性能上与最新SOTA模型M2D-CLAP相当,同时在两个关键领域显著优于:(1)文本到文本检索提升约22%(相对提升),(2)困难负样本判别能力显著提升(HNSR@10提升4.3个百分点,TFR@10提升34.7%),表明大语言模型背板在理解复杂查询方面具有优势。
引用
@article{arxiv.2604.18360,
title = {Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval},
author = {HaeJun Yoo and Yongseop Shin and Insung Lee and Myoung-Wan Koo and Du-Seong Chang},
journal= {arXiv preprint arXiv:2604.18360},
year = {2026}
}
备注
Accepted at ACL 2026 Main Conference. Camera-ready version