中文

面向指代图像分割的两阶段视觉线索增强网络

计算机视觉与模式识别 2021-10-12 v1 计算与语言

摘要

指代图像分割(RIS)旨在从图像中分割出由给定自然语言表达式所指代的目标对象。图像中多样灵活的表达以及复杂的视觉内容对 RIS 模型提出了更高要求,需要其探究表达式中词语与图像中对象之间的细粒度匹配行为。然而,当指代对象(即被指对象)的视觉线索不足时,此类匹配行为难以被学习和捕捉,因为视觉线索微弱的指代对象容易在边界处被杂乱背景混淆,甚至被图像中的显著对象淹没。而以往的跨模态融合机制无法处理这种视觉线索不足的问题。本文从增强指代对象视觉信息的新视角出发,设计了一种两阶段视觉线索增强网络(TV-Net),其中提出了一种新颖的检索与丰富方案(RES)和一个自适应多分辨率特征融合(AMF)模块。通过两阶段增强,我们所提出的 TV-Net 在学习自然语言表达式与图像之间的细粒度匹配行为方面表现更优,尤其在指代对象视觉信息不充分时,从而生成更好的分割结果。我们进行了大量实验来验证所提方法在 RIS 任务上的有效性,所提出的 TV-Net 在四个基准数据集上超越了 SOTA 方法。

关键词

引用

@article{arxiv.2110.04435,
  title  = {Two-stage Visual Cues Enhancement Network for Referring Image Segmentation},
  author = {Yang Jiao and Zequn Jie and Weixin Luo and Jingjing Chen and Yu-Gang Jiang and Xiaolin Wei and Lin Ma},
  journal= {arXiv preprint arXiv:2110.04435},
  year   = {2021}
}

备注

Accepted by ACM MM 2021