中文

利用多模态基础模型增强弱监督语义分割:一种端到端方法

计算机视觉与模式识别 2024-05-13 v1

摘要

语义分割是计算机视觉的核心问题,但高昂的数据标注成本阻碍了其广泛应用。与全监督方法相比,弱监督语义分割(WSSS)通过使用部分或不完整标签,为大量标注提供了一种经济高效的变通方案。现有的WSSS方法难以学习物体的边界,导致分割结果不佳。我们提出了一种新颖有效的框架,通过在边界框内利用视觉基础模型来解决这些问题。采用两阶段WSSS框架,我们提出的网络包含一个伪标签生成模块和一个分割模块。第一阶段利用Segment Anything Model(SAM)生成高质量的伪标签。为了缓解描绘精确边界的问题,我们在另一个预训练基础模型(例如Grounding-DINO)的帮助下,在边界框内采用SAM。此外,我们通过使用CLIP进行分类,消除了使用图像标签监督的必要性。然后在第二阶段,生成的高质量伪标签用于训练一个现成的分割器,该分割器在PASCAL VOC 2012和MS COCO 2014上实现了最先进的性能。

关键词

引用

@article{arxiv.2405.06586,
  title  = {Enhancing Weakly Supervised Semantic Segmentation with Multi-modal Foundation Models: An End-to-End Approach},
  author = {Elham Ravanbakhsh and Cheng Niu and Yongqing Liang and J. Ramanujam and Xin Li},
  journal= {arXiv preprint arXiv:2405.06586},
  year   = {2024}
}