中文

基于 REL 深度表示与球面融合的全景语义分割方法 REL-SF4PASS

计算机视觉与模式识别 2026-01-26 v1 人工智能

摘要

作为计算机视觉中重要且具有挑战性的问题,全景语义分割(Panoramic Semantic Segmentation, PASS)旨在基于超大视角提供完整的场景感知。大多数 PASS 方法关注球面几何(仅使用 RGB 输入)或使用原始或 HHA 格式的深度信息,未充分利用全景图像的几何结构。为此,我们提出了基于圆柱坐标的 REL 深度表示及球面动态多模态融合(Spherical-dynamic Multi-Modal Fusion, SMMF)的 REL-SF4PASS。REL 由校正深度、垂直倾斜角(Elevation-Gained Vertical Inclination Angle)和横向方向角(Lateral Orientation Angle)组成,完整地以圆柱坐标风格表示三维空间及曲面法向。SMMF旨在确保不同全景图像区域的融合多样性,减少 ERP 投影下圆柱侧表面扩展的断裂问题,采用不同融合策略匹配全景图像中的不同区域。实验结果表明,REL-SF4PASS 在流行基准数据集(Stanford2D3D Panoramic datasets)上显著提升了性能和鲁棒性。该方法在所有 3 个折叠上实现了 2.35% 的平均 mIoU 提升,并在面对 3D 扰动时将性能方差约降低了 70%。

关键词

引用

@article{arxiv.2601.16788,
  title  = {REL-SF4PASS: Panoramic Semantic Segmentation with REL Depth Representation and Spherical Fusion},
  author = {Xuewei Li and Xinghan Bao and Zhimin Chen and Xi Li},
  journal= {arXiv preprint arXiv:2601.16788},
  year   = {2026}
}

备注

submitted to CVPR 2026