中文

PAD3R:基于位姿感知的随意视频动态3D重建

计算机视觉与模式识别 2025-09-30 v1

摘要

我们提出了PAD3R,一种从随意拍摄的、无位姿单目视频中重建可变形3D物体的方法。与现有方法不同,PAD3R能够处理具有显著物体变形、大尺度相机运动和有限视角覆盖的长视频序列,这些特征通常对传统系统构成挑战。我们方法的核心是训练一个个性化的、以物体为中心的位姿估计器,由预训练的图像到3D模型监督。这指导了可变形3D高斯表示的优化。该优化进一步通过整个输入视频上的长期2D点跟踪进行正则化。通过结合生成先验和可微渲染,PAD3R以类别无关的方式重建物体的高保真、铰接式3D表示。大量定性和定量结果表明,PAD3R具有鲁棒性并在具有挑战性的场景中具有良好的泛化能力,突显了其在动态场景理解和3D内容创作方面的潜力。

关键词

引用

@article{arxiv.2509.25183,
  title  = {PAD3R: Pose-Aware Dynamic 3D Reconstruction from Casual Videos},
  author = {Ting-Hsuan Liao and Haowen Liu and Yiran Xu and Songwei Ge and Gengshan Yang and Jia-Bin Huang},
  journal= {arXiv preprint arXiv:2509.25183},
  year   = {2025}
}

备注

SIGGRAPH Asia 2025. Project page:https://pad3r.github.io/