中文

PanoSAMic:基于SAM特征编码和双视图融合的全景图像分割

计算机视觉与模式识别 2026-04-27 v3

摘要

现有的图像基础模型未针对球面图像进行优化,因其主要在透视图像上进行训练。PanoSAMic 将预训练的 Segment Anything (SAM) 编码器整合进语义分割模型,用于全景图像,采用多模态方法。我们修改了 SAM 编码器以输出多阶段特征,引入新型的时空-模态融合模块,使模型能够为输入的不同区域选择最相关的模态和最佳特征。此外,我们的语义解码器使用球面注意力和双视图融合,以克服全景图像常伴随的畸变和边缘连续性问题。PanoSAMic 在 Stanford2D3DS 的 RGB、RGB-D 和 RGB-D-N 模态上实现了最先进 (SotA) 的结果,并在 Matterport3D 的 RGB 和 RGB-D 模态上取得优异成绩。https://github.com/dfki-av/PanoSAMic

关键词

引用

@article{arxiv.2601.07447,
  title  = {PanoSAMic: Panoramic Image Segmentation from SAM Feature Encoding and Dual View Fusion},
  author = {Mahdi Chamseddine and Didier Stricker and Jason Rambach},
  journal= {arXiv preprint arXiv:2601.07447},
  year   = {2026}
}

备注

Accepted in ICPR 2026