PanoSAMic:基于SAM特征编码和双视图融合的全景图像分割
计算机视觉与模式识别
2026-04-27 v3
摘要
现有的图像基础模型未针对球面图像进行优化,因其主要在透视图像上进行训练。PanoSAMic 将预训练的 Segment Anything (SAM) 编码器整合进语义分割模型,用于全景图像,采用多模态方法。我们修改了 SAM 编码器以输出多阶段特征,引入新型的时空-模态融合模块,使模型能够为输入的不同区域选择最相关的模态和最佳特征。此外,我们的语义解码器使用球面注意力和双视图融合,以克服全景图像常伴随的畸变和边缘连续性问题。PanoSAMic 在 Stanford2D3DS 的 RGB、RGB-D 和 RGB-D-N 模态上实现了最先进 (SotA) 的结果,并在 Matterport3D 的 RGB 和 RGB-D 模态上取得优异成绩。https://github.com/dfki-av/PanoSAMic
引用
@article{arxiv.2601.07447,
title = {PanoSAMic: Panoramic Image Segmentation from SAM Feature Encoding and Dual View Fusion},
author = {Mahdi Chamseddine and Didier Stricker and Jason Rambach},
journal= {arXiv preprint arXiv:2601.07447},
year = {2026}
}
备注
Accepted in ICPR 2026