GREx:广义指称表达分割、理解与生成
计算机视觉与模式识别
2026-01-09 v1
摘要
指称表达分割(RES)和理解(REC)分别对用表达式描述的对象进行分割和检测,而指称表达生成(REG)则生成所选对象的表达式。现有数据集和方法通常仅支持单目标表达式,即一个表达式指代一个对象,不考虑多目标和无目标表达式。这大大限制了 REx(RES/REC/REG)在实际应用中的潜力。本文引入三个新基准数据集:广义指称表达分割(GRES)、理解(GREC)和生成(GREG),统称为 GREx,将经典 REx 扩展为允许表达式指代任意数量的对象。我们构建了第一个大规模 GREx 数据集 gRefCOCO,包含多目标、无目标和单目标表达式及其对应的图像和标记目标。GREx 和 gRefCOCO 设计为与 REx 向后兼容,便于大量实验研究现有 REx 方法在 GREx 任务上的性能差距。GRES/GREC 的一个挑战是复杂关系建模,为此我们提出了基线 ReLA,通过自适应将图像划分为带有子实例线索的区域,显式建模区域-区域和区域-语言依赖关系。所提出的 ReLA 在两个 GRES 和 GREC 任务上实现了最先进的结果。所提出的 gRefCOCO 数据集和方法可在 https://henghuiding.github.io/GREx 查阅。
引用
@article{arxiv.2601.05244,
title = {GREx: Generalized Referring Expression Segmentation, Comprehension, and Generation},
author = {Henghui Ding and Chang Liu and Shuting He and Xudong Jiang and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2601.05244},
year = {2026}
}
备注
IJCV, Project Page: https://henghuiding.com/GREx/