GoodSAM:通过分割一切模型弥合域与容量差距以实现畸变感知的全景语义分割
计算机视觉与模式识别
2024-03-26 v1
摘要
本文解决一个新颖且具有挑战性的问题:如何将新兴的分割一切模型(SAM)——其展现出令人印象深刻的零样本实例分割能力——的知识迁移至一个紧凑的全景语义分割模型(即学生模型),而无需任何标注数据。这带来了相当大的挑战,因为 SAM 无法提供语义标签,且 SAM 与学生模型之间存在巨大的容量差距。为此,我们提出了一个名为 GoodSAM 的新框架,该框架引入一个教师助理(TA)来提供语义信息,并与 SAM 集成以生成集成 logits,从而实现知识迁移。具体来说,我们提出了一个畸变感知校正(DAR)模块,该模块首先通过施加预测级一致性和边界增强来解决全景图像的畸变问题,从而巧妙地增强了 TA 在全景图像上的预测能力。然后,DAR 引入一个跨任务互补融合块,自适应地融合 SAM 和 TA 的预测,以获得更可靠的集成 logits。此外,我们引入了一个多层次知识适应(MKA)模块,以高效地将来自 TA 和集成 logits 的多层次特征知识迁移至紧凑的学生模型。在两个基准数据集上的大量实验表明,我们的 GoodSAM 相比最先进的(SOTA)域适应方法取得了显著的 +3.75% mIoU 提升。同时,我们最轻量的模型仅用 3.7M 参数就达到了与 SOTA 方法相当的性能。
引用
@article{arxiv.2403.16370,
title = {GoodSAM: Bridging Domain and Capacity Gaps via Segment Anything Model for Distortion-aware Panoramic Semantic Segmentation},
author = {Weiming Zhang and Yexin Liu and Xu Zheng and Lin Wang},
journal= {arXiv preprint arXiv:2403.16370},
year = {2024}
}
备注
Accepted to CVPR 2024