中文

面向细粒度组合指代理解的新数据集与方法:通过专家-MLLM 协作

计算机视觉与模式识别 2025-06-16 v3

摘要

指代理解(REC)是一种基础的跨模态任务,评估语言理解、图像理解和语言到图像定位之间的相互作用。它是多模态大语言模型(MLLM)的重要测试基地。为推动该领域的发展,我们在此前的会议论文中引入了新的 REC 数据集,具有两个关键特征:首先,其设计包含可控的难度水平,要求跨对象类别、属性和多跳关系的多级细粒度推理;其次,包含通过细粒度编辑和增强生成的负面文本和图像,显式测试模型拒绝目标对象缺失情形的能力——这是现有数据集中常被忽视的关键挑战。在本扩展工作中,我们提出两种新方法,通过结合专家模型和 MLLM 的优势来解决细粒度 REC 挑战。第一种方法自适应地将简单案例分配给快速轻量级模型,保留复杂案例供强大的 MLLM 处理,在准确率和效率之间进行权衡。第二种方法让专家模型生成一组可能的对象区域,由 MLLM 根据其推理能力选择最合理的区域。这些协作策略在我们的数据集和其他具有挑战性的基准测试中均取得显著的改进。我们的实验表明,结合专用模型和通用模型是解决复杂现实视觉语言任务的实用路径。我们的数据集和代码已公开:https://github.com/sleepyshep/FineCops-Ref。

关键词

引用

@article{arxiv.2502.20104,
  title  = {New Dataset and Methods for Fine-Grained Compositional Referring Expression Comprehension via Specialist-MLLM Collaboration},
  author = {Xuzheng Yang and Junzhuo Liu and Peng Wang and Guoqing Wang and Yang Yang and Heng Tao Shen},
  journal= {arXiv preprint arXiv:2502.20104},
  year   = {2025}
}

备注

Accepted by TPAMI 2025