中文

将指代表达分割从单图像推进至图像组

计算机视觉与模式识别 2023-05-23 v1

摘要

指代表达分割 (RES) 是一项被广泛探索的多模态任务,旨在根据给定语言描述在单图像中分割已存在的对象。然而,在更广阔的真实场景中,并不总是能确定所描述对象是否存在于特定图像中。通常我们拥有一组图像,其中部分可能包含所描述对象。当前的 RES 设定在此类情形下限制了其实用性。为克服该局限,我们提出了一种更真实且通用的设定,称为分组指代表达分割 (GRES),将 RES 扩展至一组相关图像,允许所描述对象出现在输入图像的子集中。为支持该新设定,我们引入了精心编译的数据集 Grouped Referring Dataset (GRD),包含由给定表达描述的目标对象的完整分组标注。我们还提出了一种基线方法 Grouped Referring Segmenter (GRSer),其显式捕获语言-视觉与组内视觉-视觉交互,在提出的 GRES 及相关任务(如协同显著目标检测和 RES)上取得了最先进结果。我们的数据集与代码将公开于 https://github.com/yixuan730/group-res。

关键词

引用

@article{arxiv.2305.12452,
  title  = {Advancing Referring Expression Segmentation Beyond Single Image},
  author = {Yixuan Wu and Zhao Zhang and Xie Chi and Feng Zhu and Rui Zhao},
  journal= {arXiv preprint arXiv:2305.12452},
  year   = {2023}
}