GroupViT:语义分割由文本监督自发涌现
计算机视觉与模式识别
2022-07-19 v5
摘要
分组与识别是视觉场景理解(如目标检测与语义分割)的重要组成部分。在端到端深度学习系统中,图像区域的分组通常借助来自像素级识别标签的自上而下监督隐式完成。与之不同,本文提出将分组机制重新引入深度网络,使得语义片段仅借助文本监督即可自动涌现。我们提出了一种分层分组视觉Transformer(GroupViT),它超越常规的网格结构表示,学习将图像区域分组为逐渐增大的任意形状片段。我们通过对比损失在大规模图文数据集上联合训练GroupViT与文本编码器。在仅使用文本监督、无任何像素级标注的情况下,GroupViT学会将语义区域分组在一起,并以零样本方式成功迁移到语义分割任务,即无需任何进一步微调。它在PASCAL VOC 2012上取得52.3% mIoU的零样本精度,在PASCAL Context数据集上取得22.4% mIoU,并与需要更强监督的最先进迁移学习方法具有竞争力。我们的代码已开源:https://github.com/NVlabs/GroupViT。
引用
@article{arxiv.2202.11094,
title = {GroupViT: Semantic Segmentation Emerges from Text Supervision},
author = {Jiarui Xu and Shalini De Mello and Sifei Liu and Wonmin Byeon and Thomas Breuel and Jan Kautz and Xiaolong Wang},
journal= {arXiv preprint arXiv:2202.11094},
year = {2022}
}
备注
CVPR 2022. Project page and code: https://jerryxu.net/GroupViT