中文

揭示物体之外的部件:迈向更细粒度的指代表达分割

计算机视觉与模式识别 2024-03-22 v2

摘要

指代表达分割(RES)旨在分割出与描述性自然语言表达相匹配的实体的前景掩码。以往用于经典RES任务的数据集和方法严重依赖于一个先验假设,即一个表达必须指向物体级别的目标。在本文中,我们更进一步,迈向更细粒度的部件级别RES任务。为了推动物体级别RES任务走向更细粒度的视觉-语言理解,我们提出了一个新的多粒度指代表达分割(MRES)任务,并通过人工标注构建了一个名为RefCOCOm的评估基准。通过使用我们自动的模型辅助数据引擎,我们构建了最大的视觉定位数据集,即MRES-32M,它在提供的100万张图像上包含超过3220万个高质量掩码和描述。此外,我们设计了一个简单而强大的模型,名为UniRES,以完成统一的物体级别和部件级别定位任务。在我们的RefCOCOm上针对MRES任务以及在三个数据集(即RefCOCO(+/g))上针对经典RES任务的大量实验,证明了我们的方法相对于先前最先进方法的优越性。为了促进未来对细粒度视觉定位的研究,我们的基准RefCOCOm、MRES-32M数据集和模型UniRES将在https://github.com/Rubics-Xuan/MRES上公开。

关键词

引用

@article{arxiv.2312.08007,
  title  = {Unveiling Parts Beyond Objects:Towards Finer-Granularity Referring Expression Segmentation},
  author = {Wenxuan Wang and Tongtian Yue and Yisi Zhang and Longteng Guo and Xingjian He and Xinlong Wang and Jing Liu},
  journal= {arXiv preprint arXiv:2312.08007},
  year   = {2024}
}

备注

This work is accepted by CVPR 2024