中文

ColLab:用于引用表达式理解与生成的协作式空间渐进数据引擎

计算机视觉与模式识别 2025-09-30 v1

摘要

引用表达式理解(REC)和引用表达式生成(REG)是多模态理解中的基础任务,支持通过自然语言进行精确目标定位。然而,现有的 REC 和 REG 数据集严重依赖人工标注,这既耗时又难以扩展。在本文中,我们提出了 ColLab,一个协作式空间渐进数据引擎,能够在无需人工监督的情况下实现完全自动化的 REC 和 REG 数据生成。具体而言,我们的方法引入了一种协作式多模态模型交互(CMMI)策略,利用多模态大语言模型(MLLM)和大语言模型(LLM)的语义理解能力来生成描述。此外,我们设计了一个称为空间渐进增强(SPA)的模块,用于增强重复实例之间的空间表达能力。实验表明,ColLab 显著加速了 REC 和 REG 的标注过程,同时提升了生成表达式的质量和区分度。除了核心方法学贡献外,我们的框架已被部分采用在 ICCV 2025 MARS2 多模态推理挑战赛的数据生成流水线中,丰富了数据集并加入了更多样化、更具挑战性的样本,以更好地反映真实世界的推理需求。

关键词

引用

@article{arxiv.2509.23955,
  title  = {ColLab: A Collaborative Spatial Progressive Data Engine for Referring Expression Comprehension and Generation},
  author = {Shilan Zhang and Jirui Huang and Ruilin Yao and Cong Wang and Yaxiong Chen and Peng Xu and Shengwu Xiong},
  journal= {arXiv preprint arXiv:2509.23955},
  year   = {2025}
}