中文

ImageScope:基于大型多模态模型集体推理统一语言导向图像检索

信息检索 2025-03-14 v1 人工智能 多媒体

摘要

随着在线内容中图像的普及,语言导向图像检索(LGIR)已成为过去十年研究热点,涵盖多种不同输入形式的子任务。虽然大型多模态模型(LMM)的发展显著促进了这些任务,但现有方法常以孤立方式处理,需为每个任务构建独立系统。这不仅增加系统复杂性和维护成本,还加剧了语言歧义和复杂图像内容带来的挑战,使检索系统难以提供准确可靠的结果。为此,我们提出 ImageScope,一个无需训练的三阶段框架,利用集体推理统一 LGIR 任务。统一的关键思想在于语言的组合性,将 diverse LGIR 任务转化为通用的文本到图像检索过程,同时利用 LMM 推理作为通用验证以细化结果。具体而言,在第一阶段,我们通过链式思维(CoT)推理综合不同语义粒度层次的搜索意图,以提高框架的鲁棒性。在第二和第三阶段,我们通过局部验证谓词命题并进行全局成对评估来反思检索结果。在六个 LGIR 数据集上的实验表明,ImageScope 在对抗基线方法方面表现更佳。综合评估和消融研究进一步确认了我们设计的有效性。

关键词

引用

@article{arxiv.2503.10166,
  title  = {ImageScope: Unifying Language-Guided Image Retrieval via Large Multimodal Model Collective Reasoning},
  author = {Pengfei Luo and Jingbo Zhou and Tong Xu and Yuan Xia and Linli Xu and Enhong Chen},
  journal= {arXiv preprint arXiv:2503.10166},
  year   = {2025}
}

备注

WWW 2025