E-RayZer:自监督3D重建作为空间视觉预训练
计算机视觉与模式识别
2026-03-31 v2
摘要
自监督预训练已推动语言、2D图像和视频基础模型的快速进展,但针对从多视角图像学习3D感知表示的研究仍 largely 未被探索。在本文中,我们提出了E-RayZer,一个自监督3D视觉模型,直接从无标注图像中学习几何基础的表示。与先前自监督方法(如RayZer)通过潜在空间视图合成间接推断3D不同,E-RayZer直接在3D空间中操作,通过显式几何进行自监督3D重建。该公式消除了捷径解,并产生3D感知的表示。为确保收敛性和可扩展性,我们引入了一个细粒度的学习课程,从易到难组织训练,并协调异构数据源而无需任何监督。实验表明,E-RayZer在姿态估计上显著优于RayZer,并在某些情况下匹配或超越完全监督重建模型如VGGT。此外,其学习表示在3D下游任务上优于领先的视觉预训练模型(如DINOv3、CroCo v2、VideoMAE V2和RayZer),确立了E-RayZer作为空间视觉预训练的有前景范式。
引用
@article{arxiv.2512.10950,
title = {E-RayZer: Self-supervised 3D Reconstruction as Spatial Visual Pre-training},
author = {Qitao Zhao and Hao Tan and Qianqian Wang and Sai Bi and Kai Zhang and Kalyan Sunkavalli and Shubham Tulsiani and Hanwen Jiang},
journal= {arXiv preprint arXiv:2512.10950},
year = {2026}
}
备注
CVPR 2026 Camera-ready. Project website: https://qitaozhao.github.io/E-RayZer