中文

基于文本监督的指代图像分割

计算机视觉与模式识别 2023-08-29 v1

摘要

现有的指代图像分割(RIS)方法通常需要昂贵的像素级或框级标注用于监督。本文中,我们观察到 RIS 中使用的指代文本已提供充足信息来定位目标对象。因此,我们提出一种新颖的弱监督 RIS 框架,将目标定位问题表述为区分正、负文本表达的二分类过程。虽然一幅图像的指代文本表达用作正表达,但来自其他图像的指代文本表达可用作该图像的负表达。我们的框架有三个主要创新点。首先,我们提出一种双向提示方法,通过协调视觉与语言特征间的域差异来促进分类过程。其次,我们提出一种校准方法以减少噪声背景信息并提高目标对象定位响应图的正确性。第三,我们提出一种正响应图选择策略,从增强的响应图中生成高质量伪标签,用于训练 RIS 推理的分割网络。为评估,我们提出一种新指标来衡量定位精度。在四个基准上的实验表明,我们的框架相对于现有全监督 RIS 方法取得了有前景的性能,同时优于从相关领域适配的最先进弱监督方法。代码见 https://github.com/fawnliu/TRIS。

关键词

引用

@article{arxiv.2308.14575,
  title  = {Referring Image Segmentation Using Text Supervision},
  author = {Fang Liu and Yuhao Liu and Yuqiu Kong and Ke Xu and Lihe Zhang and Baocai Yin and Gerhard Hancke and Rynson Lau},
  journal= {arXiv preprint arXiv:2308.14575},
  year   = {2023}
}

备注

ICCV 2023