中文

RoboVIP:通过视觉身份提示增强机器人操作的多视图视频生成

计算机视觉与模式识别 2026-01-09 v1 人工智能 机器人学

摘要

操作数据的多样性、数量和质量对训练有效机器人策略至关重要。然而,由于硬件和物理设置的限制,跨越多样化环境收集大规模真实世界操作数据仍具有可扩展性挑战。最近的工作使用文本提示条件化的图像扩散模型,通过改变视觉观察中的背景和桌面对象来增强操作数据。然而,这些方法往往忽视了面向最先进策略模型所需的多视图和时序连贯观察的实际需求。此外,文本提示本身无法可靠指定场景设置。为为扩散模型提供明确的视觉指导,我们引入视觉身份提示(visual identity prompting),该提示作为条件输入供给示例图像,以引导生成所需场景设置的生成。为此,我们还构建了一个可扩展的管道,从大型机器人数据集中筛选出视觉身份池。使用我们增强的操作数据训练下游视觉-语言-动作和视觉运动策略模型,可在仿真和真实机器人设置中实现一致的性能提升。

关键词

引用

@article{arxiv.2601.05241,
  title  = {RoboVIP: Multi-View Video Generation with Visual Identity Prompting Augments Robot Manipulation},
  author = {Boyang Wang and Haoran Zhang and Shujie Zhang and Jinkun Hao and Mingda Jia and Qi Lv and Yucheng Mao and Zhaoyang Lyu and Jia Zeng and Xudong Xu and Jiangmiao Pang},
  journal= {arXiv preprint arXiv:2601.05241},
  year   = {2026}
}