中文

统一球面前端:从任意相机学习旋转等变球面图像表示

计算机视觉与模式识别 2026-03-31 v2

摘要

现代感知越来越依赖鱼眼、全景及其他宽视场 (FoV) 相机,但大多数管线仍针对针孔镜头的平面CNN在二维网格上工作,其中像素空间的邻域不准确地代表了物理相邻性,且模型对全局旋转敏感。传统球面CNN部分缓解了这种不匹配,但需要高成本的球面调和变换,这限制了分辨率和效率。我们提出统一球面前端 (USF),一个无畸变、镜头无关的框架,通过射线方向对应将任意已校准相机的图像映射到单位球面上,在空间域中进行球面重采样、卷积和池化。USF模块化:投影、位置采样、值插值和分辨率控制完全解耦。其可配置的仅基于距离的卷积核提供旋转等变性,类似平面CNN中的平移等变性,却完全避免了调和变换。我们在合成数据集 (Spherical MNIST) 和真实数据集 (PANDORA, Stanford 2D-3D-S) 上,对比了多个标准平面骨干网络与其球面对应版本,进行分类、检测和分割任务,并测试了对极端镜头畸变、变化视场和任意旋转的鲁棒性。USF能够高效扩展到高分辨率球面图像,在无训练时旋转增强的情况下,保持不到1%的性能下降,并能够对任何不可见的(宽FoV)镜头实现零样本泛化,性能下降最小。

关键词

引用

@article{arxiv.2511.18174,
  title  = {Unified Spherical Frontend: Learning Rotation-Equivariant Representations of Spherical Images from Any Camera},
  author = {Mukai Yu and Mosam Dabhi and Liuyue Xie and Sebastian Scherer and László A. Jeni},
  journal= {arXiv preprint arXiv:2511.18174},
  year   = {2026}
}

备注

Accepted to CVPR 2026. Camera-ready version. Added computation benchmark