中文

将空间一致分组与文本监督语义分割相结合

计算机视觉与模式识别 2023-04-04 v1

摘要

在本工作中,我们研究仅通过图像-句子对训练来执行语义分割。由于缺乏稠密标注,现有文本监督方法只能通过像素不敏感的反馈将图像分组为语义区域。因此,其分组结果粗糙且常包含小的伪区域,限制了分割的上界性能。另一方面,我们观察到自监督模型的分组结果在语义上更具一致性,打破了现有方法的瓶颈。受此启发,我们引入将自监督空间一致分组与文本监督语义分割相结合。考虑到类部件的分组结果,我们通过两个核心设计进一步将文本监督模型从图像级识别适配到区域级识别。首先,我们鼓励细粒度对齐,采用单向名词到区域对比损失,减少不匹配的名词-区域对。其次,我们采用上下文感知掩码策略,以同时识别所有分组区域。结合空间一致分组与区域适配识别,我们的方法在 Pascal VOC 和 Pascal Context 基准上分别取得 59.2% mIoU 和 32.4% mIoU,显著超越最先进方法。

关键词

引用

@article{arxiv.2304.01114,
  title  = {Associating Spatially-Consistent Grouping with Text-supervised Semantic Segmentation},
  author = {Yabo Zhang and Zihao Wang and Jun Hao Liew and Jingjia Huang and Manyu Zhu and Jiashi Feng and Wangmeng Zuo},
  journal= {arXiv preprint arXiv:2304.01114},
  year   = {2023}
}