OmniSAM:用于全景语义分割无监督域适应的全向分割一切模型
计算机视觉与模式识别
2025-10-14 v3
摘要
分割一切模型 2 (SAM2) 已成为各种针孔成像分割任务中的强大基础模型。然而,将其应用于 域时,针孔图像()与全景图像()之间显著的视场(FoV)差异带来了独特的挑战。该应用的两个主要问题包括:1) 域之间巨大 FoV 差异导致的不可避免畸变与物体变形;2) 原始 SAM2 无法提供像素级语义理解。为解决这些问题,我们提出了一种新颖的 OmniSAM 框架,首次尝试将 SAM2 应用于全景语义分割。具体而言,为弥合第一个差距,OmniSAM 首先将全景图划分为图像块序列。这些图像块随后被视作视频分割任务中的图像序列。我们随后利用 SAM2 的记忆机制提取跨图像块对应关系,嵌入跨 FoV 依赖性,从而改善特征连续性及掩膜边界处的预测一致性。针对第二个差距,OmniSAM 对预训练图像编码器进行微调,并复用掩膜解码器进行语义预测。此外,还引入了基于 FoV 的原型适应模块与动态伪标签更新机制,以促进记忆特征与主干特征的对齐,从而提升模型在不同大小源模型间的泛化能力。大量实验结果表明,OmniSAM 大幅优于现有 SOTA 方法,例如在 SPin8-to-SPan8 上达到 79.06% (+10.22%),在 CS13-to-DP13 上达到 62.46% (+6.58%)。
引用
@article{arxiv.2503.07098,
title = {OmniSAM: Omnidirectional Segment Anything Model for UDA in Panoramic Semantic Segmentation},
author = {Ding Zhong and Xu Zheng and Chenfei Liao and Yuanhuiyi Lyu and Jialei Chen and Shengyang Wu and Linfeng Zhang and Xuming Hu},
journal= {arXiv preprint arXiv:2503.07098},
year = {2025}
}