SWEET:稀疏世界建模与图像编辑用于具身任务执行
计算机视觉与模式识别
2026-05-20 v1
摘要
视觉预测已成为具身控制的有前景范例,其中生成未来观察再转化为动作。然而,稠密视频生成计算昂贵且对许多操作任务不必要,其进展可由少数任务相关视觉状态概括。本文研究图像编辑模型是否可作为稀疏视觉世界模型,通过预测任务级未来状态而无需稠密视频 rollout。我们首先在相同机器人数据设置下对比视频生成模型 Wan2.2 和图像编辑模型 FLUX-Kontext,发现图像编辑在更可靠的任务级关键帧、更佳视觉保真度和显著更低的推理成本方面表现更优。鼓励此观察,我们提出了 SWEET,一个单次稀疏视觉规划框架,通过连续图像编辑逐步生成以语言指令和可选箭头式空间指导为条件的任务相关操作关键帧序列。随后,一个以目标为条件的扩散动作预测器将相邻想象的关键帧转换为可执行动作块。为减少真实与编辑视觉子目标之间的差异,我们进一步引入混合训练策略以过滤编辑目标。在 DROID 和 RoboMimic 上的实验表明,SWEET 在已见及未见场景中提升了关键帧预测,并实现了从顺序关键帧规划到可执行机器人动作的完整管道,表明图像编辑是具身视觉预测的有前景且尚未充分探索的方向。
引用
@article{arxiv.2605.19319,
title = {SWEET: Sparse World Modeling with Image Editing for Embodied Task Execution},
author = {Yiren Song and Yihan Wang and Xiyao Deng and Zhuoran Yan and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2605.19319},
year = {2026}
}