GoodSAM++:基于Segment Anything Model 用于全景语义分割的桥接域间和容量差距
计算机视觉与模式识别
2024-08-20 v1
摘要
本文提出了 GoodSAM++,一种新型框架利用 SAM(即教师模型)强大的零样本实例分割能力来学习紧凑的全景语义分割模型(即学生模型),无需任何标记数据。GoodSAM++ 解决了两个关键挑战:1)SAM 无法提供语义标签以及全景图像的固有畸变问题;2)SAM 与学生模型之间的显著容量差距。GoodSAM++ 的“开箱即用”洞见在于引入教师助理 (TA) 为 SAM 提供语义信息,与 SAM 集成以获取可靠的伪语义图,从而桥接域间和容量差距。为实现这一点,我们首先提出了失真感知矫正 (DARv2) 模块以解决域间差距。它有效缓解了全景图像中对象变形和畸变问题,以获取伪语义图。随后我们引入多级知识适应 (MKA) 模块高效地将来自 TA 和伪语义图的语义信息传递给紧凑的学生模型,以解决显著的容量差距。我们在室内外基准数据集上进行了广泛实验,表明 GoodSAM++ 在语义分割任务上显著优于当前最先进 (SOTA) 的域适应方法。此外,多样化的开放世界场景证明了 GoodSAM++ 的泛化能力。最后,我们最轻量的学生模型仅使用 370 万参数即可实现与 SOTA 模型相当的性能。
引用
@article{arxiv.2408.09115,
title = {GoodSAM++: Bridging Domain and Capacity Gaps via Segment Anything Model for Panoramic Semantic Segmentation},
author = {Weiming Zhang and Yexin Liu and Xu Zheng and Lin Wang},
journal= {arXiv preprint arXiv:2408.09115},
year = {2024}
}
备注
15 pages, under review. arXiv admin note: substantial text overlap with arXiv:2403.16370