中文

ZeroHSI:通过视频生成实现零-shot 4D 人体-场景交互

计算机视觉与模式识别 2025-03-24 v2 图形学

摘要

人体-场景交互 (HSI) 生成对于具身 AI、虚拟现实和机器人等应用至关重要。然而,现有方法无法合成未见环境(如野生场景或重建场景)中的交互,因为它们依赖于训练时的配对 3D 场景和捕获的人体动作数据,而这些在未见环境中不可得。我们提出 ZeroHSI,一种新的方法,使其能够在无需在任何 MoCap 数据上进行训练的情况下实现零-shot 4D 人体-场景交互合成。我们的关键思想是从最先进的视频生成模型中蒸馏人体-场景交互,这些模型已在大量自然人体动作和交互方面进行了训练,并使用可微分渲染来重建人体-场景交互。ZeroHSI 能够在静态场景和带有动态物体的环境中合成逼真的人体动作,无需任何 ground-truth 动作数据。我们在包含不同室内外场景类型的精选数据集上评估了 ZeroHSI,证明了其能够生成多样且情境恰当的人体-场景交互的能力。

关键词

引用

@article{arxiv.2412.18600,
  title  = {ZeroHSI: Zero-Shot 4D Human-Scene Interaction by Video Generation},
  author = {Hongjie Li and Hong-Xing Yu and Jiaman Li and Jiajun Wu},
  journal= {arXiv preprint arXiv:2412.18600},
  year   = {2025}
}

备注

Project website: https://awfuact.github.io/zerohsi/ The first two authors contribute equally