PAM:用于 Sim-to-Real HOI 视频生成的姿态-外观-运动引擎
计算机视觉与模式识别
2026-04-03 v3
摘要
手部-物体相互作用(HOI)重建与合成正变得成为具身 AI 和 AR/VR 的核心问题。尽管取得了快速进展,但现有的 HOI 生成研究仍在三个相互独立的方向上碎片化:(1)仅姿态合成,通过预测 MANO 轨迹但不生成像素;(2)单图像 HOI 生成,从掩码或 2D 线索幻觉生成外观但缺乏动态;(3)视频生成方法需要整个姿态序列和真实第一帧作为输入,阻碍了真正的 Sim-to-Real 部署。以 Joo 等人(2018)的哲学为灵感,我们认为 HOI 生成需要一个统一的引擎,将姿态、外观和运动整合到一个连贯的框架中。因此我们引入 PAM:一个用于可控 HOI 视频生成的姿态-外观-运动引擎。我们验证了该引擎的性能:(1)在 DexYCB 上,我们获得了 FVD 为 29.13(与 InterDyn 的 38.83 比),MPJPE 为 19.37 mm(与 CosHand 的 30.05 mm 比),同时生成更高分辨率的 480x720 视频,与 256x256 和 256x384 的基线相比;(2)在 OAKINK2 上,我们的完整多条件模型将 FVD 从 68.76 降低到 46.31;(3)在 DexYCB 上对输入条件进行消融实验表明,结合深度、分割和关键点始终能获得最佳结果;(4)对于下游手部姿态估计任务使用 SimpleHand,通过增强训练数据引入 3400 个合成视频(20.7 万帧),使仅使用 50% 真实数据加我们合成数据的模型能够达到 100% 真实基线的性能。
关键词
引用
@article{arxiv.2603.22193,
title = {PAM: A Pose-Appearance-Motion Engine for Sim-to-Real HOI Video Generation},
author = {Mingju Gao and Kaisen Yang and Huan-ang Gao and Bohan Li and Ao Ding and Wenyi Li and Yangcheng Yu and Jinkun Liu and Shaocong Xu and Yike Niu and Haohan Chi and Hao Chen and Hao Tang and Yu Zhang and Li Yi and Hao Zhao},
journal= {arXiv preprint arXiv:2603.22193},
year = {2026}
}
备注
Accepted to CVPR 2026 Code: https://github.com/GasaiYU/PAM