中文

通过视觉动作提示实现精确的动作到视频生成

计算机视觉与模式识别 2025-08-19 v1 机器人学

摘要

我们提出了视觉动作提示,这是一种统一的动作表示,用于生成复杂高自由度交互的动作到视频,同时保持跨域的可迁移视觉动态。动作驱动的视频生成面临精度与通用性之间的权衡:现有方法使用文本、基本动作或粗略掩码,虽具通用性但缺乏精度;而以智能体为中心的动作信号虽提供精度,却以牺牲跨域可迁移性为代价。为平衡动作精度与动态可迁移性,我们提出将动作“渲染”为精确的视觉提示,作为与域无关的表示,既保留复杂动作的几何精度,又保持跨域适应性;具体而言,我们选择视觉骨架,因其通用性和可获取性。我们提出了稳健的流程,从两个交互丰富的数据源——人-物交互(HOI)和灵巧机器人操作——构建骨架,从而实现对动作驱动生成模型的跨域训练。通过轻量级微调将视觉骨架集成到预训练视频生成模型中,我们实现了对复杂交互的精确动作控制,同时保留了对跨域动态的学习。在EgoVid、RT-1和DROID上的实验证明了我们提出方法的有效性。项目页面:https://zju3dv.github.io/VAP/。

关键词

引用

@article{arxiv.2508.13104,
  title  = {Precise Action-to-Video Generation Through Visual Action Prompts},
  author = {Yuang Wang and Chao Wen and Haoyu Guo and Sida Peng and Minghan Qin and Hujun Bao and Xiaowei Zhou and Ruizhen Hu},
  journal= {arXiv preprint arXiv:2508.13104},
  year   = {2025}
}

备注

Accepted to ICCV 2025. Project page: https://zju3dv.github.io/VAP/