扩散引导的日常手-物交互片段重建
计算机视觉与模式识别
2023-09-12 v1
摘要
我们着手从短视频片段重建手-物交互。给定输入视频,我们的方法将 3D 推断视为逐视频优化,恢复物体形状的神经 3D 表示以及时变运动与手部关节运动。虽然输入视频自然提供一些多视角线索以引导 3D 推断,但因遮挡与有限视角变化,这些线索本身并不充分。为获得精确 3D,我们用通用数据驱动先验增强多视角信号以引导重建。具体而言,我们训练一个扩散网络来建模物体(几何)渲染在手部构型与类别标签条件下的条件分布,并将其作为先验引导重建场景的新视角渲染。我们在涵盖 6 个物体类别的第一视角视频上实证评估了方法,观察到相较先前单视角与多视角方法的显著提升。最后,我们展示了系统从 YouTube 重建任意片段的能力,呈现第一与第三人称交互。
引用
@article{arxiv.2309.05663,
title = {Diffusion-Guided Reconstruction of Everyday Hand-Object Interaction Clips},
author = {Yufei Ye and Poorvi Hebbar and Abhinav Gupta and Shubham Tulsiani},
journal= {arXiv preprint arXiv:2309.05663},
year = {2023}
}
备注
Accepted to ICCV23 (Oral). Project Page: https://judyye.github.io/diffhoi-www/