中文

全监督与弱监督指代表达式分割的端到端学习

计算机视觉与模式识别 2022-12-21 v1

摘要

指代表达式分割(RES)旨在根据给定语言表达式定位并分割目标,已引起越来越多的关注。现有方法联合考虑定位与分割步骤,依赖融合的视觉与语言特征来完成这两个步骤。我们认为,识别物体与生成掩码之间的目的冲突限制了 RES 性能。为解决该问题,我们提出一种并行“定位-核-分割”流程,以更好地隔离并继而交互定位与分割步骤。在我们的流程中,语言信息不会直接污染用于分割的视觉特征。具体而言,定位步骤基于指代表达式在图像中定位目标物体,随后从定位步骤获得的视觉核引导分割步骤。该流程还使我们能够以弱监督方式训练 RES,其中像素级分割标签被中心点与角点上的点击标注所替代。定位头为全监督并使用点击标注作为监督,分割头使用弱监督分割损失进行训练。为在弱监督设定下验证我们的框架,我们为三个 RES 基准数据集(RefCOCO、RefCOCO+ 和 RefCOCOg)标注了点击标注。我们的方法简洁却出奇有效,在全监督与弱监督设定下均以大幅优势超越所有先前最先进的 RES 方法。基准代码与数据集将公开发布。

关键词

引用

@article{arxiv.2212.10278,
  title  = {Fully and Weakly Supervised Referring Expression Segmentation with End-to-End Learning},
  author = {Hui Li and Mingjie Sun and Jimin Xiao and Eng Gee Lim and Yao Zhao},
  journal= {arXiv preprint arXiv:2212.10278},
  year   = {2022}
}