面向通用视觉-语言全监督分割的研究
计算机视觉与模式识别
2023-03-14 v1
摘要
现有开放世界通用分割方法通常利用CLIP与预计算提议掩码,将开放世界分割任务视为提议分类。然而,1)这些工作无法以端到端方式处理通用分割,2)全景数据集规模有限制约了在thing类上的开放世界分割能力。本文提出视觉-语言全监督分割(VLOSS)。VLOSS以带CLIP文本编码器的Mask2Former通用分割框架为起点。为提升开放世界分割能力,我们将全监督数据(即全景分割数据、目标检测数据与图像-文本对数据)引入训练,从而丰富开放世界分割能力并取得更优分割精度。为更好提升训练效率并充分释放全监督数据威力,我们提出若干先进技术:FPN风格编码器、可切换训练技术与正分类损失。得益于所提技术的端到端训练方式,VLOSS可应用于各类开放世界分割任务而无需进一步适配。在不同开放世界全景与实例分割基准上的实验结果证明了VLOSS的有效性。值得注意的是,参数量更少的情况下,我们基于Swin-Tiny骨干的VLOSS在LVIS v1数据集上以掩码AP计超越MaskCLIP约2%。
引用
@article{arxiv.2303.06547,
title = {Towards Universal Vision-language Omni-supervised Segmentation},
author = {Bowen Dong and Jiaxi Gu and Jianhua Han and Hang Xu and Wangmeng Zuo},
journal= {arXiv preprint arXiv:2303.06547},
year = {2023}
}