中文

基于语言-视觉提示的低数据实例分割无监督预训练

计算机视觉与模式识别 2024-05-24 v1

摘要

近年来,遵循 DETR (DEtection TRansformer) 范式,基于查询的端到端实例分割 (QEIS) 方法在大规模数据集上训练时,展现出了优于 CNN 模型的性能。然而,当训练数据有限时,这些 QEIS 方法的有效性会显著降低。这一局限性源于它们依赖大量数据来有效训练对于获取定位和形状先验至关重要的关键查询/核。为了解决这一问题,我们提出了一种在低数据场景下的无监督预训练新方法。受近期成功的提示技术启发,我们引入了一种新方法,即基于语言-视觉提示的无监督预训练 (UPLVP),它通过将语言-视觉提示引入查询/核来改进 QEIS 模型的实例分割。我们的方法包含三部分:(1) 掩码提议:利用语言-视觉模型基于无标签图像生成伪掩码。(2) 提示-核匹配:将伪掩码转换为提示,并将最佳匹配的定位和形状特征注入其对应的核中。(3) 核监督:在核级别制定预训练监督以确保鲁棒学习。借助我们的预训练方法,QEIS 模型在低数据场景下能够更快收敛,并且表现优于基于 CNN 的模型。在 MS COCO、Cityscapes 和 CTW1500 数据集上进行的实验评估表明,使用我们的方法进行预训练可以显著提升 QEIS 模型的性能。代码将开源于:https://github.com/lifuguan/UPLVP。

关键词

引用

@article{arxiv.2405.13388,
  title  = {Unsupervised Pre-training with Language-Vision Prompts for Low-Data Instance Segmentation},
  author = {Dingwen Zhang and Hao Li and Diqi He and Nian Liu and Lechao Cheng and Jingdong Wang and Junwei Han},
  journal= {arXiv preprint arXiv:2405.13388},
  year   = {2024}
}

备注

https://github.com/lifuguan/UPLVP