中文

MERIT:基于交错多条件查询的多语言语义检索

计算机视觉与模式识别 2025-12-04 v3 计算与语言 多媒体

摘要

语义检索对现代应用至关重要,但在当前研究中仍被低估。现有数据集局限于单语言、单图像或单一检索条件,往往无法充分利用视觉信息的表达能力,这从图像被替换为描述时性能仍得以维持便可看出。然而,实际检索场景常涉及包含多张图像的交错多条件查询。因此,本文引入 MERIT——首个用于交错多条件语义检索的多语言数据集,包含 5 种语言的 320,000 个查询和 135,000 个产品,覆盖 7 个不同产品类别。在 MERIT 上的广泛实验揭示了现有模型的局限性:仅关注全局语义信息而忽略查询中的特定条件元素。因此,我们提出 Coral,一种新颖的微调框架,通过整合嵌入重建来保留细粒度条件元素,并通过对比学习来提取全面的全局语义,从而适配预训练的多模态大语言模型。实验表明,Coral 在 MERIT 上相比传统方法实现了 45.9% 的性能提升,并在 8 个已建立的检索基准上验证了强大的泛化能力。综合来看,我们的贡献——一个新颖数据集、对现有方法关键局限性的识别以及一个创新的微调框架——为交错多条件语义检索的未来研究奠定了基础。

关键词

引用

@article{arxiv.2506.03144,
  title  = {MERIT: Multilingual Semantic Retrieval with Interleaved Multi-Condition Query},
  author = {Wei Chow and Yuan Gao and Linfeng Li and Xian Wang and Qi Xu and Hang Song and Lingdong Kong and Ran Zhou and Yi Zeng and Yidong Cai and Botian Jiang and Shilin Xu and Jiajun Zhang and Minghui Qiu and Xiangtai Li and Tianshu Yang and Siliang Tang and Juncheng Li},
  journal= {arXiv preprint arXiv:2506.03144},
  year   = {2025}
}

备注

NeurIPS 2025; Project Page, Code, and Dataset at: https://merit-2025.github.io/