将指代表达分割从单图像推进至图像组
计算机视觉与模式识别
2023-05-23 v1
摘要
指代表达分割 (RES) 是一项被广泛探索的多模态任务,旨在根据给定语言描述在单图像中分割已存在的对象。然而,在更广阔的真实场景中,并不总是能确定所描述对象是否存在于特定图像中。通常我们拥有一组图像,其中部分可能包含所描述对象。当前的 RES 设定在此类情形下限制了其实用性。为克服该局限,我们提出了一种更真实且通用的设定,称为分组指代表达分割 (GRES),将 RES 扩展至一组相关图像,允许所描述对象出现在输入图像的子集中。为支持该新设定,我们引入了精心编译的数据集 Grouped Referring Dataset (GRD),包含由给定表达描述的目标对象的完整分组标注。我们还提出了一种基线方法 Grouped Referring Segmenter (GRSer),其显式捕获语言-视觉与组内视觉-视觉交互,在提出的 GRES 及相关任务(如协同显著目标检测和 RES)上取得了最先进结果。我们的数据集与代码将公开于 https://github.com/yixuan730/group-res。
引用
@article{arxiv.2305.12452,
title = {Advancing Referring Expression Segmentation Beyond Single Image},
author = {Yixuan Wu and Zhao Zhang and Xie Chi and Feng Zhu and Rui Zhao},
journal= {arXiv preprint arXiv:2305.12452},
year = {2023}
}