DeVI:基于合成视频模仿的物理合理灵巧人物交互
计算机视觉与模式识别
2026-04-23 v1
摘要
视频生成模型的最新进展使得能够合成跨广泛场景和物体类别的逼真人物交互视频,包括难以用动作捕捉系统捕获的复杂灵巧操作。虽然这些合成视频中蕴含的丰富交互知识对于灵巧机器人操作中的运动规划具有巨大潜力,但它们有限的物理保真度和纯二维特性使其难以直接用作基于物理的角色控制中的模仿目标。我们提出了DeVI(灵巧视频模仿),这是一个新颖的框架,它利用文本条件的合成视频来实现物理上合理的灵巧智能体控制,以与未见过的目标物体进行交互。为了克服生成式二维线索的不精确性,我们引入了一种混合跟踪奖励,将三维人体跟踪与鲁棒的二维物体跟踪相结合。与依赖高质量三维运动学演示的方法不同,DeVI仅需要生成的视频,从而能够跨不同物体和交互类型实现零样本泛化。大量实验表明,DeVI在模仿三维人物交互演示方面优于现有方法,特别是在建模灵巧手-物交互方面。我们进一步验证了DeVI在多物体场景和文本驱动的动作多样性方面的有效性,展示了将视频用作具有人物交互感知的运动规划器的优势。
引用
@article{arxiv.2604.20841,
title = {DeVI: Physics-based Dexterous Human-Object Interaction via Synthetic Video Imitation},
author = {Hyeonwoo Kim and Jeonghwan Kim and Kyungwon Cho and Hanbyul Joo},
journal= {arXiv preprint arXiv:2604.20841},
year = {2026}
}
备注
Project Page: https://snuvclab.github.io/devi/