IDMR:面向多模态检索的实例驱动精准视觉对应
计算机视觉与模式识别
2025-04-02 v1 人工智能
摘要
多模态检索系统正变得越来越重要,正在推动具身AI和AI驱动的数字内容产业等前沿AI技术的发展。然而,当前的多模态检索任务缺乏足够的复杂性,显示出有限的实际应用价值。由此驱动我们设计了实例驱动的多模态图像检索(IDMR),一种新颖任务,要求模型在检索包含与查询图像相同实例的图像的同时匹配文本描述的情景。与专注于全局图像相似性或类别级匹配的现有检索任务不同,IDMR要求在多样化情境下实现细粒度的实例级一致性。为评估这一能力,我们开发了IDMR-bench,基于真实世界的目标跟踪和一线视频数据。为解决训练数据稀缺问题,我们提出一种跨域合成方法,通过裁剪标准检测数据集中的目标创建55.7万训练样本。我们基于120万样本训练的多模态大语言模型(MLLM)检索模型在传统基准测试和零样本IDMR-bench上均超越了最先进的方法。实验结果表明,现有模型在实例感知检索方面存在局限性,突显了MLLM在高级检索应用中的潜力。整个训练数据集、代码和模型均提供,规模各异,可在 https://github.com/BwLiu01/IDMR 获取。
引用
@article{arxiv.2504.00954,
title = {IDMR: Towards Instance-Driven Precise Visual Correspondence in Multimodal Retrieval},
author = {Bangwei Liu and Yicheng Bao and Shaohui Lin and Xuhong Wang and Xin Tan and Yingchun Wang and Yuan Xie and Chaochao Lu},
journal= {arXiv preprint arXiv:2504.00954},
year = {2025}
}