中文

GoodSAM++:基于Segment Anything Model 用于全景语义分割的桥接域间和容量差距

计算机视觉与模式识别 2024-08-20 v1

摘要

本文提出了 GoodSAM++,一种新型框架利用 SAM(即教师模型)强大的零样本实例分割能力来学习紧凑的全景语义分割模型(即学生模型),无需任何标记数据。GoodSAM++ 解决了两个关键挑战:1)SAM 无法提供语义标签以及全景图像的固有畸变问题;2)SAM 与学生模型之间的显著容量差距。GoodSAM++ 的“开箱即用”洞见在于引入教师助理 (TA) 为 SAM 提供语义信息,与 SAM 集成以获取可靠的伪语义图,从而桥接域间和容量差距。为实现这一点,我们首先提出了失真感知矫正 (DARv2) 模块以解决域间差距。它有效缓解了全景图像中对象变形和畸变问题,以获取伪语义图。随后我们引入多级知识适应 (MKA) 模块高效地将来自 TA 和伪语义图的语义信息传递给紧凑的学生模型,以解决显著的容量差距。我们在室内外基准数据集上进行了广泛实验,表明 GoodSAM++ 在语义分割任务上显著优于当前最先进 (SOTA) 的域适应方法。此外,多样化的开放世界场景证明了 GoodSAM++ 的泛化能力。最后,我们最轻量的学生模型仅使用 370 万参数即可实现与 SOTA 模型相当的性能。

关键词

引用

@article{arxiv.2408.09115,
  title  = {GoodSAM++: Bridging Domain and Capacity Gaps via Segment Anything Model for Panoramic Semantic Segmentation},
  author = {Weiming Zhang and Yexin Liu and Xu Zheng and Lin Wang},
  journal= {arXiv preprint arXiv:2408.09115},
  year   = {2024}
}

备注

15 pages, under review. arXiv admin note: substantial text overlap with arXiv:2403.16370