图像生成作为机器人操作的视觉规划器
计算机视觉与模式识别
2025-12-02 v1 机器人学
摘要
生成逼真的机器人操作视频是统一具身智能体感知、规划与动作的重要步骤。虽然现有视频扩散模型需要大量领域特定数据集且难以泛化,但最近在语言-图像语料库上训练的图像生成模型表现出强大的组合性,包括合成时序一致网格图的能力。这表明即使没有显式时序建模,图像生成模型也具备类似视频的生成潜能。我们探索此类模型在轻微适配后(使用LoRA微调)是否可作为机器人视觉规划器。我们提出了两部分框架:(1)文本条件生成,使用语言指令和第一帧;(2)轨迹条件生成,使用2D轨迹叠加层和相同的初始帧。在Jaco Play数据集、Bridge V2和RT1数据集上的实验表明,两种模式均产生与各自条件相匹配的平滑、连贯的机器人视频。我们的发现表明,预训练的图像生成器编码了可迁移的时序先验,可在最小监督下作为类视频机器人规划器发挥作用。代码已发布。
引用
@article{arxiv.2512.00532,
title = {Image Generation as a Visual Planner for Robotic Manipulation},
author = {Ye Pang},
journal= {arXiv preprint arXiv:2512.00532},
year = {2025}
}
备注
11 pages 9 figures Under review at CVPR 2026