中文

先定位后分割:指代图像分割的强有力流水线

计算机视觉与模式识别 2021-03-31 v1

摘要

指代图像分割旨在分割由自然语言表达式所指称的物体。以往方法通常侧重于设计隐式且循环的特征交互机制来融合视觉-语言特征,以直接生成最终分割掩码,而未显式建模所指实例的定位信息。为解决这些问题,我们从另一视角看待该任务,将其解耦为“先定位后分割”(LTS)方案。给定语言表达式,人们通常先对相应目标图像区域施加注意,再基于其上下文生成关于物体的精细分割掩码。LTS 首先提取并融合视觉与文本特征以获得跨模态表示,然后在视觉-文本特征上施加跨模态交互以利用位置先验定位所指物体,最后通过轻量分割网络生成分割结果。我们的 LTS 简洁却出奇有效。在三个流行基准数据集上,LTS 大幅优于以往所有最先进方法(例如 RefCOCO+ 上 +3.2%,RefCOCOg 上 +3.4%)。此外,我们的模型通过显式定位物体更具可解释性,这亦由可视化实验所证实。我们相信该框架有望作为指代图像分割的强基线。

关键词

引用

@article{arxiv.2103.16284,
  title  = {Locate then Segment: A Strong Pipeline for Referring Image Segmentation},
  author = {Ya Jing and Tao Kong and Wei Wang and Liang Wang and Lei Li and Tieniu Tan},
  journal= {arXiv preprint arXiv:2103.16284},
  year   = {2021}
}

备注

CVPR 2021