AnyLift:基于 2D 扩散的互联网视频运动重建扩展方法
计算机视觉与模式识别
2026-04-21 v1
摘要
从互联网视频中重建 3D 人体运动和人体-物体交互(HOI)是构建大规模人类行为数据集的基本步骤。现有方法在动态相机下难以恢复全局一致的 3D 运动,尤其对于当前运动捕捉数据集中缺乏代表的运动类型,还面临在 3D 空间中恢复连贯人体-物体交互的额外困难。我们引入一个两阶段框架,利用 2D 扩散从互联网视频中重建 3D 人体运动和 HOI。在第一阶段,我们合成每个领域的多视角 2D 运动数据,利用从互联网视频中提取的 2D 关键点,纳入当前 MoCap 数据集中罕见出现的人类运动。在第二阶段,在该领域特定的合成数据上训练一个基于相机的多视角 2D 运动扩散模型,以在世界空间中恢复 3D 人体运动和 3D HOI。我们在具有挑战性运动(如体操)以及野生 HOI 视频上展示了方法的有效性,显示其在生成逼真的人体运动和人体-物体交互方面优于先前工作。
引用
@article{arxiv.2604.17818,
title = {AnyLift: Scaling Motion Reconstruction from Internet Videos via 2D Diffusion},
author = {Hongjie Li and Heng Yu and Jiaman Li and Hong-Xing Yu and Ehsan Adeli and C. Karen Liu and Jiajun Wu},
journal= {arXiv preprint arXiv:2604.17818},
year = {2026}
}
备注
CVPR 2026. Project website: https://awfuact.github.io/anylift/ The first two authors contribute equally