中文

VHOI:通过运动稠密化从稀疏轨迹生成可控的人-物互动视频

计算机视觉与模式识别 2026-04-09 v2

摘要

合成逼真的人-物互动 (HOI) 视频具有挑战性,因为人的和物体的互动动力学具有复杂且特定于实例的特征。将可控性引入视频生成 further 增加了复杂性。现有的可控视频生成方法面临权衡:稀疏控制(如关键点轨迹)易于指定但缺乏实例感知,而稠密信号(如光流、深度或 3D 网格)信息丰富但获取成本高。我们提出 VHOI,一个两阶段框架,首先将稀疏轨迹稠密化为 HOI 掩码序列,然后微调以这些稠密掩码为条件的视频扩散模型。我们引入一种新颖的 HOI 感知运动表示方式,使用颜色编码区分不仅人类和物体的运动,还区分身体部位特有的动力学。这种设计将人类先验纳入条件信号,强化模型理解和生成逼真 HOI 动力学的能力。实验表明,VHOI 在可控 HOI 视频生成方面实现了最先进的效果。VHOI 不仅限于互动场景,还能端到端生成人类在与物体互动前的完整导航。项目页面:https://vcai.mpi-inf.mpg.de/projects/vhoi/。

关键词

引用

@article{arxiv.2512.09646,
  title  = {VHOI: Controllable Video Generation of Human-Object Interactions from Sparse Trajectories via Motion Densification},
  author = {Wanyue Zhang and Lin Geng Foo and Thabo Beeler and Rishabh Dabral and Christian Theobalt},
  journal= {arXiv preprint arXiv:2512.09646},
  year   = {2026}
}