中文

让多模态嵌入器在需要时学习如何增广查询

计算与语言 2025-11-05 v1 人工智能 信息检索 机器学习 多媒体

摘要

查询增广通过添加额外信息来使查询更具意义,从而找到相关文档。当前研究提出了大语言模型 (LLM) 驱动的嵌入器,通过利用 LLM 的生成能力,以多任务方式学习嵌入表示和查询增广生成。推理时,这些联合训练的嵌入器会先进行查询增广再进行嵌入,效果显著。然而,对每个查询进行增广会导致显著的嵌入延迟,而且查询增广对某些查询可能适得其反。此外,现有方法在多模态环境中尚未得到探索。为此,我们提出了 M-Solomon,一个通用的多模态嵌入器,能够自适应地确定何时需要增广查询。我们的方案首先将训练数据集的查询分为两个组:一组需要增广,另一组不需要增广。然后,我们引入一种合成过程,通过强大的多模态 LLM (MLLM) 为需要增广的查询生成合适的增广。接着,我们提出自适应查询增广。通过此步骤,M-Solomon 仅在必要时进行查询增广,通过学习为需要增广的查询生成前缀 /augment 的合成增广,而为不需要增广的查询生成简单字符串 /embed。实验结果表明,M-Solomon 不仅在大幅度超过无增广基线,还超过始终使用增广的基线,显著降低了嵌入延迟。

关键词

引用

@article{arxiv.2511.02358,
  title  = {Let Multimodal Embedders Learn When to Augment Query via Adaptive Query Augmentation},
  author = {Wongyu Kim and Hochang Lee and Sanghak Lee and Yoonsung Kim and Jaehyun Park},
  journal= {arXiv preprint arXiv:2511.02358},
  year   = {2025}
}

备注

Accepted to MMGenSR Workshop (CIKM 2025)