中文

学习用视频扩散模型生成刚体交互

计算机视觉与模式识别 2026-03-24 v3 人工智能 机器学习

摘要

近期的视频生成模型取得了显著进展,并已部署于电影、社交媒体制作和广告领域。除了其创造潜力外,此类模型还有望作为机器人技术和具身决策的世界模拟器。尽管取得了强劲进展,当前方法仍难以生成物理上合理的物体交互,且缺乏物体级别的控制机制。为了解决这些局限性,我们引入了 KineMask,一种支持真实刚体控制、交互和效果的视频生成方法。给定单张图像和指定的物体速度,我们的方法能生成具有推断运动和未来物体交互的视频。我们提出了一种两阶段训练策略,通过物体掩码逐步移除未来运动监督。使用该策略,我们在简单交互的合成场景上训练视频扩散模型(VDMs),并展示了对真实场景中刚体及手物交互的显著改进与泛化能力。此外,KineMask 通过预测的场景描述将低层运动控制与高层文本条件相结合,从而支持复杂动态现象的合成。我们的实验表明,KineMask 能够泛化至不同的 VDMs,并在与同等规模的近期模型对比中取得了显著提升。消融研究进一步突出了 VDMs 中低层和高层条件控制的互补作用。项目页面:https://daromog.github.io/KineMask/

关键词

引用

@article{arxiv.2510.02284,
  title  = {Learning to Generate Rigid Body Interactions with Video Diffusion Models},
  author = {David Romero and Ariana Bermudez and Viacheslav Iablochnikov and Hao Li and Fabio Pizzati and Ivan Laptev},
  journal= {arXiv preprint arXiv:2510.02284},
  year   = {2026}
}