GroundingSuite:衡量复杂多粒度像素 grounding
计算机视觉与模式识别
2025-07-16 v3
摘要
像素 grounding 包含诸如指代语义分割(Referring Expression Segmentation, RES)等任务,因其在视觉与语言模态之间搭建桥梁的巨大潜力而受到广泛关注。然而,当前该领域的进展受限于现有数据集的局限,包括对象类别有限、文本多样性不足以及高质量标注匮乏。为缓解这些限制,我们引入 GroundingSuite,其包括:(1)一种利用多个视觉-语言模型(VLM)代理进行自动数据标注的框架;(2)一个大规模训练数据集,涵盖 956 万条多样化指代表达式及其对应的分割;(3)一个严格筛选的评估基准,包含 3800 张图像。GroundingSuite 训练数据集促进了显著的性能提升,使在 gRefCOCO 上实现 68.9 的 cIoU,在 RefCOCOm 上实现 55.3 的 gIoU。此外,GroundingSuite 标注框架的效率优于当前领先的数据标注方法——快于 GLaMM 的 4.5 倍。
引用
@article{arxiv.2503.10596,
title = {GroundingSuite: Measuring Complex Multi-Granular Pixel Grounding},
author = {Rui Hu and Lianghui Zhu and Yuxuan Zhang and Tianheng Cheng and Lei Liu and Heng Liu and Longjin Ran and Xiaoxin Chen and Wenyu Liu and Xinggang Wang},
journal= {arXiv preprint arXiv:2503.10596},
year = {2025}
}
备注
To appear at ICCV 2025. Code: https://github.com/hustvl/GroundingSuite