中文

E-RayZer:自监督3D重建作为空间视觉预训练

计算机视觉与模式识别 2026-03-31 v2

摘要

自监督预训练已推动语言、2D图像和视频基础模型的快速进展,但针对从多视角图像学习3D感知表示的研究仍 largely 未被探索。在本文中,我们提出了E-RayZer,一个自监督3D视觉模型,直接从无标注图像中学习几何基础的表示。与先前自监督方法(如RayZer)通过潜在空间视图合成间接推断3D不同,E-RayZer直接在3D空间中操作,通过显式几何进行自监督3D重建。该公式消除了捷径解,并产生3D感知的表示。为确保收敛性和可扩展性,我们引入了一个细粒度的学习课程,从易到难组织训练,并协调异构数据源而无需任何监督。实验表明,E-RayZer在姿态估计上显著优于RayZer,并在某些情况下匹配或超越完全监督重建模型如VGGT。此外,其学习表示在3D下游任务上优于领先的视觉预训练模型(如DINOv3、CroCo v2、VideoMAE V2和RayZer),确立了E-RayZer作为空间视觉预训练的有前景范式。

关键词

引用

@article{arxiv.2512.10950,
  title  = {E-RayZer: Self-supervised 3D Reconstruction as Spatial Visual Pre-training},
  author = {Qitao Zhao and Hao Tan and Qianqian Wang and Sai Bi and Kai Zhang and Kalyan Sunkavalli and Shubham Tulsiani and Hanwen Jiang},
  journal= {arXiv preprint arXiv:2512.10950},
  year   = {2026}
}

备注

CVPR 2026 Camera-ready. Project website: https://qitaozhao.github.io/E-RayZer