中文

图像生成作为机器人操作的视觉规划器

计算机视觉与模式识别 2025-12-02 v1 机器人学

摘要

生成逼真的机器人操作视频是统一具身智能体感知、规划与动作的重要步骤。虽然现有视频扩散模型需要大量领域特定数据集且难以泛化,但最近在语言-图像语料库上训练的图像生成模型表现出强大的组合性,包括合成时序一致网格图的能力。这表明即使没有显式时序建模,图像生成模型也具备类似视频的生成潜能。我们探索此类模型在轻微适配后(使用LoRA微调)是否可作为机器人视觉规划器。我们提出了两部分框架:(1)文本条件生成,使用语言指令和第一帧;(2)轨迹条件生成,使用2D轨迹叠加层和相同的初始帧。在Jaco Play数据集、Bridge V2和RT1数据集上的实验表明,两种模式均产生与各自条件相匹配的平滑、连贯的机器人视频。我们的发现表明,预训练的图像生成器编码了可迁移的时序先验,可在最小监督下作为类视频机器人规划器发挥作用。代码已发布。

关键词

引用

@article{arxiv.2512.00532,
  title  = {Image Generation as a Visual Planner for Robotic Manipulation},
  author = {Ye Pang},
  journal= {arXiv preprint arXiv:2512.00532},
  year   = {2025}
}

备注

11 pages 9 figures Under review at CVPR 2026