中文

S3O:从单目视频中重建铰接物体动态形状与骨架的双阶段方法

计算机视觉与模式识别 2024-05-22 v1

摘要

从单个单目视频中重建动态铰接物体具有挑战性,需要从有限视角联合估计形状、运动和相机参数。现有方法通常需要大量的计算资源和训练时间,并且需要预定义参数化模型、相机位姿和关键点等额外的人工标注,这限制了其泛化能力。我们提出了协同形状与骨架优化(Synergistic Shape and Skeleton Optimization, S3O),这是一种新颖的两阶段方法,无需这些先决条件即可高效学习包含可见形状和底层骨架的参数化模型。传统策略通常同时学习所有参数,导致相互依赖,其中一个错误的预测可能引发显著误差。相比之下,S3O 采用分阶段方法:首先专注于学习粗略的参数化模型,然后进行运动学习和细节添加。该方法大幅降低了计算复杂度,并增强了从有限视角进行重建的鲁棒性,且无需任何额外标注。为解决当前单目视频 3D 重建基准的不足,我们收集了 PlanetZoo 数据集。我们在标准基准和 PlanetZoo 数据集上的实验评估证实,S3O 提供了更准确的 3D 重建和合理的骨架,并且与 SOTA 相比将训练时间减少了约 60%,从而推进了动态物体重建领域的 SOTA。

关键词

引用

@article{arxiv.2405.12607,
  title  = {S3O: A Dual-Phase Approach for Reconstructing Dynamic Shape and Skeleton of Articulated Objects from Single Monocular Video},
  author = {Hao Zhang and Fang Li and Samyak Rawlekar and Narendra Ahuja},
  journal= {arXiv preprint arXiv:2405.12607},
  year   = {2024}
}

备注

Accepted by ICML 2024