Pow3R:通过相机和场景先验实现无约束 3D 重建
计算机视觉与模式识别
2025-03-24 v1
摘要
我们提出了 Pow3r,一种新型大规模 3D 视觉回归模型,其输入模态性非常灵活。不同于以往的前馈模型 lacks 任何机制在测试时利用已知相机或场景先验的能力,Pow3r 将任何组合的辅助信息(如内参、相对姿态、稠密或稀疏深度)与输入图像一起纳入单个网络。基于最近的 DUSt3R范式,即一种利用强大预训练的 transformer 架构,Pow3r 的轻量且灵活的条件充当额外的指导,帮助网络在可用辅助信息时预测更精确的估计。在训练期间,我们在每次迭代中随机输入子集的模态,从而使模型能够在测试时以不同程度的已知先验进行推理。这进而开辢了新的能力,例如以原始图像分辨率进行推理,或进行点云补全。我们在 3D 重建、深度完成、多视图深度预测、多视图立体和多视图姿态估计等任务上进行了实验,取得了最先进的结果,确认了 Pow3r 在充分利用所有可用信息方面的有效性。项目网页为 https://europe.naverlabs.com/pow3r。
引用
@article{arxiv.2503.17316,
title = {Pow3R: Empowering Unconstrained 3D Reconstruction with Camera and Scene Priors},
author = {Wonbong Jang and Philippe Weinzaepfel and Vincent Leroy and Lourdes Agapito and Jerome Revaud},
journal= {arXiv preprint arXiv:2503.17316},
year = {2025}
}
备注
CVPR 2025