PAD3R:基于位姿感知的随意视频动态3D重建
计算机视觉与模式识别
2025-09-30 v1
摘要
我们提出了PAD3R,一种从随意拍摄的、无位姿单目视频中重建可变形3D物体的方法。与现有方法不同,PAD3R能够处理具有显著物体变形、大尺度相机运动和有限视角覆盖的长视频序列,这些特征通常对传统系统构成挑战。我们方法的核心是训练一个个性化的、以物体为中心的位姿估计器,由预训练的图像到3D模型监督。这指导了可变形3D高斯表示的优化。该优化进一步通过整个输入视频上的长期2D点跟踪进行正则化。通过结合生成先验和可微渲染,PAD3R以类别无关的方式重建物体的高保真、铰接式3D表示。大量定性和定量结果表明,PAD3R具有鲁棒性并在具有挑战性的场景中具有良好的泛化能力,突显了其在动态场景理解和3D内容创作方面的潜力。
引用
@article{arxiv.2509.25183,
title = {PAD3R: Pose-Aware Dynamic 3D Reconstruction from Casual Videos},
author = {Ting-Hsuan Liao and Haowen Liu and Yiran Xu and Songwei Ge and Gengshan Yang and Jia-Bin Huang},
journal= {arXiv preprint arXiv:2509.25183},
year = {2025}
}
备注
SIGGRAPH Asia 2025. Project page:https://pad3r.github.io/