中文

人类作为校准图案:从非同步且非标定视频进行动态3D场景重建

计算机视觉与模式识别 2025-03-11 v2

摘要

近期关于动态3D神经场重建的工作假设输入来自同步多视角视频且已知其姿态。这些输入约束在实际场景中常不满足,从而使方法难以实际应用。我们表明,只要视频捕获了人类运动,就可以生成动态神经场。人类是视频中最常见的动态主体,其形状和姿态可使用最先进的库进行估计。虽然估计的人类形状和姿态参数较为嘈杂,但它们为启动高度非凸且受约束的训练一致动态神经表征提供了相当好的初始点。基于单个帧中人类的形状和姿态参数,我们构建方法来计算视频之间的时间偏移量,随后进行基于3D关节点位置的相机姿态估计。然后,我们采用多分辨率网格训练动态神经场,同时共同细化时间偏移量和相机姿态。该设置仍涉及优化大量参数;因此,我们引入一种稳健的渐进式学习策略以稳定整个过程。实验表明,我们的方法在具有挑战性条件下实现了准确的时空校准和高质量场景重建。

关键词

引用

@article{arxiv.2412.19089,
  title  = {Humans as a Calibration Pattern: Dynamic 3D Scene Reconstruction from Unsynchronized and Uncalibrated Videos},
  author = {Changwoon Choi and Jeongjun Kim and Geonho Cha and Minkwan Kim and Dongyoon Wee and Young Min Kim},
  journal= {arXiv preprint arXiv:2412.19089},
  year   = {2025}
}