RayZer:一种自监督的大视角合成模型
计算机视觉与模式识别
2025-05-02 v1
摘要
我们提出了RayZer,这是一种自监督的多视角3D视觉模型,在训练时无需任何3D监督,即无需相机位姿和场景几何信息,却能展现出涌现的3D感知能力。具体而言,RayZer以无位姿、未标定的图像作为输入,恢复相机参数,重建场景表示,并合成新视角。在训练过程中,RayZer仅依赖其自预测的相机位姿来渲染目标视图,从而消除了对任何真实相机标注的需求,使得RayZer能够通过2D图像监督进行训练。RayZer涌现的3D感知能力归因于两个关键因素。首先,我们设计了一个自监督框架,通过解耦相机表示和场景表示,实现了输入图像的3D感知自编码。其次,我们设计了一个基于Transformer的模型,其中唯一的3D先验是光线结构,它同时连接了相机、像素和场景。RayZer在新视角合成任务上展现出与依赖位姿标注进行训练和测试的“神谕”方法相当甚至更优的性能。项目地址:https://hwjiang1510.github.io/RayZer/
引用
@article{arxiv.2505.00702,
title = {RayZer: A Self-supervised Large View Synthesis Model},
author = {Hanwen Jiang and Hao Tan and Peng Wang and Haian Jin and Yue Zhao and Sai Bi and Kai Zhang and Fujun Luan and Kalyan Sunkavalli and Qixing Huang and Georgios Pavlakos},
journal= {arXiv preprint arXiv:2505.00702},
year = {2025}
}