中文

Predict-Optimize-Distill:用于4D对象理解的自我改进循环

计算机视觉与模式识别 2025-04-25 v1

摘要

人类可以通过长时间观察来建立对预测未见对象3D配置的直觉。随着我们对对象运动的观察越来越多,我们就能更快地立即预测其3D状态。现有系统要么从多视图观察中优化底层表示,要么从监督数据集中训练前馈预测器。我们引入Predict-Optimize-Distill(POD),一个自我改进的框架,通过交错地交织预测和优化来实现随观察时间增加的更好4D对象理解。给定一个多视图物体扫描和一段人类-物体交互的长时段单目视频,POD迭代训练神经网络从RGB帧预测局部部件姿态,使用该预测器初始化全局优化以通过逆渲染细化输出姿态,然后通过生成来自新视角的合成自标记训练数据来将优化结果蒸馏回模型。每个迭代都改进预测模型和优化运动轨迹,形成一个自我激励的循环,通过循环式细化来扩展其训练数据以学习物体的姿态配置。我们还引入一种准多视图矿掘策略,以利用长视频减少深度歧义。我们在14个真实世界和5个合成物体上进行评估,包括各种关节类型,如转动关节和滑移关节以及部分可分离或重新连接的多部件配置。POD相对于纯优化基线表现显著提升,后者在局部极小值处停滞,尤其是在较长视频方面。我们还发现POD的性能会随视频长度和自我改进循环的连续迭代次数而提升,凸显了其随额外观察和循环细化而扩展性能的能力。

关键词

引用

@article{arxiv.2504.17441,
  title  = {Predict-Optimize-Distill: A Self-Improving Cycle for 4D Object Understanding},
  author = {Mingxuan Wu and Huang Huang and Justin Kerr and Chung Min Kim and Anthony Zhang and Brent Yi and Angjoo Kanazawa},
  journal= {arXiv preprint arXiv:2504.17441},
  year   = {2025}
}

备注

See our website at: https://predict-optimize-distill.github.io/pod.github.io First two authors contributed equally