中文

基于基础模型的少样本全景分割

计算机视觉与模式识别 2024-09-12 v3 机器人学

摘要

当前最先进的全景分割方法需要大量标注训练数据,这些数据获取既费力又昂贵,对其广泛应用构成了重大挑战。与此同时,视觉表示学习的近期突破引发了范式转变,导致了可使用完全无标注图像训练的大型基础模型的出现。在这项工作中,我们提出利用此类任务无关的图像特征,通过提出 Segmenting Panoptic Information with Nearly 0 labels (SPINO) 来实现少样本全景分割。具体而言,我们的方法将 DINOv2 骨干与用于语义分割和边界估计的轻量级网络头相结合。我们表明,尽管仅使用十张标注图像训练,我们的方法能预测高质量的伪标签,可与任何现有全景分割方法配合使用。值得注意的是,我们证明 SPINO 在使用少于 0.3% 的真实标签的情况下,取得了与全监督基线相比具有竞争力的结果,为利用基础模型学习复杂视觉识别任务铺平了道路。为说明其普遍适用性,我们进一步将 SPINO 部署于真实世界的机器人视觉系统,涵盖室外与室内环境。为促进未来研究,我们在 http://spino.cs.uni-freiburg.de 公开了代码和训练好的模型。

关键词

引用

@article{arxiv.2309.10726,
  title  = {Few-Shot Panoptic Segmentation With Foundation Models},
  author = {Markus Käppeler and Kürsat Petek and Niclas Vödisch and Wolfram Burgard and Abhinav Valada},
  journal= {arXiv preprint arXiv:2309.10726},
  year   = {2024}
}

备注

Accepted for "IEEE International Conference on Robotics and Automation (ICRA) 2024"