Rig3R:面向学习式 3D 重建的设备感知条件化
计算机视觉与模式识别
2025-06-04 v1
摘要
在自动驾驶等具身 AI 应用中,从多相机设备估计智能体位姿与 3D 场景结构是一项核心任务。近期如 DUSt3R 等学习式方法在多视图设置中展现出优异性能。然而,这些模型将图像视为非结构化集合,限制了其在帧由具有已知或可推断结构的同步设备捕获场景中的有效性。为此,我们引入了 Rig3R,作为先前多视图重建模型的推广,它在可用时结合设备结构,在不可用时学习推断该结构。Rig3R 以可选的设备元数据(包括相机 ID、时间和设备位姿)为条件,构建一个对缺失信息保持稳健的设备感知潜空间。它联合预测点图和两种射线图:相对于全局坐标系的位姿射线图,以及相对于跨时间一致的以设备为中心坐标系的设备射线图。设备射线图允许模型在元数据缺失时直接从输入图像推断设备结构。Rig3R 在 3D 重建、相机位姿估计和设备发现上实现了 SOTA 性能,在多样化的真实世界设备数据集上以 17-45% 的 mAA 优势优于传统和学习式方法,所有这些均在单次前向传播中完成,无需后处理或迭代细化。
引用
@article{arxiv.2506.02265,
title = {Rig3R: Rig-Aware Conditioning for Learned 3D Reconstruction},
author = {Samuel Li and Pujith Kachana and Prajwal Chidananda and Saurabh Nair and Yasutaka Furukawa and Matthew Brown},
journal= {arXiv preprint arXiv:2506.02265},
year = {2025}
}