FlowDreamer:用于机器人操作的基于流的RGB-D世界模型
机器人学
2025-05-16 v1 计算机视觉与模式识别
摘要
本文探讨如何训练更好的机器人操作视觉世界模型,即能够依据过去的帧和机器人动作来预测未来视觉观察的模型。具体而言,我们关注 operate on RGB-D帧(RGB-D世界模型)的世界模型。与处理动态预测的典型方法不同,这些方法主要是隐式地处理动态,并在单个模型中与视觉渲染进行统一;我们引入FlowDreamer,采用3D场景流作为显式的运动表示。FlowDreamer首先从过去的帧和动作条件预测3D场景流,然后利用场景流进行扩散模型预测未来帧。尽管FlowDreamer具有模块化结构,却进行端到端训练。我们在4个不同基准上进行实验,涵盖视频预测和视觉规划任务。结果表明,FlowDreamer在语义相似性、像素质量和各种机器人操作领域的成功率方面分别优于其他基线RGB-D世界模型提升了7%、11%和6%。
引用
@article{arxiv.2505.10075,
title = {FlowDreamer: A RGB-D World Model with Flow-based Motion Representations for Robot Manipulation},
author = {Jun Guo and Xiaojian Ma and Yikai Wang and Min Yang and Huaping Liu and Qing Li},
journal= {arXiv preprint arXiv:2505.10075},
year = {2025}
}
备注
Project page: see https://sharinka0715.github.io/FlowDreamer/