中文

面向鲁棒的指代图像分割

计算机视觉与模式识别 2023-07-25 v2

摘要

指代图像分割(RIS)是一项基础的视觉-语言任务,根据文本描述输出对象掩码。许多工作在 RIS 上取得了可观进展,包括不同的融合方法设计。本文中,我们探究一个本质问题:“如果文本描述错误或有误导性怎么办?”例如,所描述的对象不在图像中。我们将此类句子称为负样本句子。然而,现有的 RIS 方案无法处理此种设定。为此,我们提出 RIS 的一种新形式化,称为鲁棒指代图像分割(R-RIS)。它除常规的正向文本输入外,还考虑负样本句子输入。为推进这一新任务,我们通过为负样本句子扩充现有 RIS 数据集,创建了三个 R-RIS 数据集,并提出了以统一方式评估两类输入的新的度量指标。此外,我们提出了一种基于 transformer 的新模型,称为 RefSegformer,带有基于 token 的视觉与语言融合模块。我们的设计可通过添加额外的空白 token 轻松扩展到我们的 R-RIS 设定。我们提出的 RefSegformer 在 RIS 和 R-RIS 数据集上均取得了最先进的结果,为两种设定建立了坚实的基线。我们的项目页面位于 \url{https://github.com/jianzongwu/robust-ref-seg}。

关键词

引用

@article{arxiv.2209.09554,
  title  = {Towards Robust Referring Image Segmentation},
  author = {Jianzong Wu and Xiangtai Li and Xia Li and Henghui Ding and Yunhai Tong and Dacheng Tao},
  journal= {arXiv preprint arXiv:2209.09554},
  year   = {2023}
}

备注

update more results