GRES:广义指代表达分割
计算机视觉与模式识别
2023-06-02 v1
摘要
指代表达分割(RES)旨在为给定语言描述所指的物体生成分割掩码。现有经典 RES 数据集与方法通常仅支持单目标表达,即一个表达指代一个目标物体,未考虑多目标与无目标表达。这限制了 RES 的实际应用。本文引入一种称为广义指代表达分割(GRES)的新基准,将经典 RES 扩展为允许表达指代任意数量的目标物体。为此,我们构建了首个大规模 GRES 数据集 gRefCOCO,包含多目标、无目标和单目标表达。GRES 与 gRefCOCO 设计为与 RES 良好兼容,便于开展广泛实验以研究现有 RES 方法在 GRES 任务上的性能差距。在实验研究中,我们发现 GRES 的一大挑战是复杂关系建模。基于此,我们提出基于区域的 GRES 基线 ReLA,其自适应地将图像划分为具有子实例线索的区域,并显式建模区域-区域与区域-语言依赖。所提方法 ReLA 在 newly proposed 的 GRES 与经典 RES 任务上均取得新的最先进性能。所提 gRefCOCO 数据集与方法见 https://henghuiding.github.io/GRES。
引用
@article{arxiv.2306.00968,
title = {GRES: Generalized Referring Expression Segmentation},
author = {Chang Liu and Henghui Ding and Xudong Jiang},
journal= {arXiv preprint arXiv:2306.00968},
year = {2023}
}
备注
CVPR2023 Highlight, Project Page: https://henghuiding.github.io/GRES/