中文

ViewCo:通过多视图语义一致性发现文本监督的分割掩码

计算机视觉与模式识别 2023-02-22 v1 人工智能 计算与语言

摘要

近来,从文本监督学习视觉表示取得巨大成功,催生了文本监督语义分割。然而,现有工作聚焦于像素分组与跨模态语义对齐,忽视了同一图像多个增强视图间的对应。为克服该局限,我们提出用于文本监督语义分割的多视图一致学习(ViewCo)。具体而言,我们首先提出文本到视图一致性建模,以学习同一输入图像多视图的对应。此外,我们提出跨视图分割一致性建模,通过对比 Siamese 视觉编码器的分割特征来解决文本监督的歧义问题。文本到视图一致性通过鼓励不同裁剪与同一文本对齐,裨益视觉特征的密集分配;而跨视图分割一致性建模提供额外自监督,克服文本监督对分割掩码歧义的局限。经大规模图文数据训练,我们的模型可直接以零样本方式分割任意类别对象。大量实验表明,ViewCo 在 PASCAL VOC2012、PASCAL Context 与 COCO 上分别以 mIoU 平均超越最优方法达 2.9%、1.6% 与 2.4%。

关键词

引用

@article{arxiv.2302.10307,
  title  = {ViewCo: Discovering Text-Supervised Segmentation Masks via Multi-View Semantic Consistency},
  author = {Pengzhen Ren and Changlin Li and Hang Xu and Yi Zhu and Guangrun Wang and Jianzhuang Liu and Xiaojun Chang and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2302.10307},
  year   = {2023}
}