基于 REL 深度表示与球面融合的全景语义分割方法 REL-SF4PASS
计算机视觉与模式识别
2026-01-26 v1 人工智能
摘要
作为计算机视觉中重要且具有挑战性的问题,全景语义分割(Panoramic Semantic Segmentation, PASS)旨在基于超大视角提供完整的场景感知。大多数 PASS 方法关注球面几何(仅使用 RGB 输入)或使用原始或 HHA 格式的深度信息,未充分利用全景图像的几何结构。为此,我们提出了基于圆柱坐标的 REL 深度表示及球面动态多模态融合(Spherical-dynamic Multi-Modal Fusion, SMMF)的 REL-SF4PASS。REL 由校正深度、垂直倾斜角(Elevation-Gained Vertical Inclination Angle)和横向方向角(Lateral Orientation Angle)组成,完整地以圆柱坐标风格表示三维空间及曲面法向。SMMF旨在确保不同全景图像区域的融合多样性,减少 ERP 投影下圆柱侧表面扩展的断裂问题,采用不同融合策略匹配全景图像中的不同区域。实验结果表明,REL-SF4PASS 在流行基准数据集(Stanford2D3D Panoramic datasets)上显著提升了性能和鲁棒性。该方法在所有 3 个折叠上实现了 2.35% 的平均 mIoU 提升,并在面对 3D 扰动时将性能方差约降低了 70%。
引用
@article{arxiv.2601.16788,
title = {REL-SF4PASS: Panoramic Semantic Segmentation with REL Depth Representation and Spherical Fusion},
author = {Xuewei Li and Xinghan Bao and Zhimin Chen and Xi Li},
journal= {arXiv preprint arXiv:2601.16788},
year = {2026}
}
备注
submitted to CVPR 2026