WHOLE:从 egocentric 视频中提取以世界为基础的手-物体运动
计算机视觉与模式识别
2026-02-26 v1
摘要
以 egocentric 方式的操纵视频面临严重遮挡问题,以及人员移动时物体频繁进入和离开摄像机视野的挑战。当前方法通常仅专注于独立恢复手部或物体姿态,但在相互作用期间效果不佳,且难以处理视野外的情况。此外,这些独立预测常常导致手-物体关系不一致。我们提出 WHOLE 方法,从 egocentric 视频中给定物体模板,综合重建手和物体在世界空间中的运动。我们的关键洞察是学习手-物体运动的生成式先验,以联合推理它们的相互作用。在测试阶段,预训练的先验被引导生成符合视频观察的轨迹。这种联合生成式重建在手部运动估计、6D 物体姿态估计以及相对相互作用重建方面均超越处理手和物体独立步骤并进行后处理的方法。WHOLE 在手运动估计、6D 物体姿态估计和相对相互作用重建方面实现了最先进的性能。项目网址:https://judyye.github.io/whole-www
引用
@article{arxiv.2602.22209,
title = {WHOLE: World-Grounded Hand-Object Lifted from Egocentric Videos},
author = {Yufei Ye and Jiaman Li and Ryan Rong and C. Karen Liu},
journal= {arXiv preprint arXiv:2602.22209},
year = {2026}
}
备注
Project website: https://judyye.github.io/whole-www