中文

通过符号引导从未标记视频中提取视觉计划

机器人学 2025-08-08 v2

摘要

视觉规划通过为目标导向的低层策略提供一系列中间视觉子目标,能够在长期操作任务中取得良好性能。为了获得这些子目标,现有方法通常依赖视频生成模型,但会受到模型幻觉和计算成本的限制。我们提出了 Vis2Plan,一个由符号引导驱动的高效、可解释且白盒视觉规划框架。从原始未标记的玩法数据中,Vis2Plan 利用视觉基础模型自动提取一组紧凑的任务符号,从而构建用于多目标、多阶段规划的高层符号转换图。在测试阶段,给定 desired 任务目标后,我们的规划器在符号层面上进行规划,并通过所依赖的符号表示将其拼接为一系列物理上一致的中间子目标图像。我们的 Vis2Plan 在实际机器人设置下,相较于强大的扩散视频生成式视觉规划器,实现了 53% 更高的综合成功率,同时生成视觉计划的速度快 35 倍。结果表明,Vis2Plan 能够生成物理上一致的图像目标,同时提供完全可检查的推理步骤。

关键词

引用

@article{arxiv.2505.08444,
  title  = {Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance},
  author = {Wenyan Yang and Ahmet Tikna and Yi Zhao and Yuying Zhang and Luigi Palopoli and Marco Roveri and Joni Pajarinen},
  journal= {arXiv preprint arXiv:2505.08444},
  year   = {2025}
}