基于物理世界模型的机器人学习
机器人学
2025-11-11 v1 人工智能
计算机视觉与模式识别
摘要
我们提出 PhysWorld 框架,通过物理世界建模实现机器人从视频生成中进行学习。最新的视频生成模型能够从语言命令和图像生成逼真的视觉演示,为机器人提供了强大且充满潜力的训练信号。然而,直接将生成视频中的像素运动重新映射到机器人上会忽略物理规律,常导致操作不准确。PhysWorld 通过将视频生成与物理世界重建耦合来解决这一限制。给定单张图像和任务命令,本方法生成任务条件视频并从视频中重建底层物理世界,通过基于物理世界模型的对象中心残差强化学习,将生成视频的运动锚定为物理准确的动作。这种协同作用将隐式的视觉指导转化为可执行的机器人轨迹,无需真实机器人数据收集即可实现零样本通用机器人操作。在多样化的真实任务实验中,PhysWorld 显示显著优于先前方法的操作精度。详情请访问项目网页。
引用
@article{arxiv.2511.07416,
title = {Robot Learning from a Physical World Model},
author = {Jiageng Mao and Sicheng He and Hao-Ning Wu and Yang You and Shuyang Sun and Zhicheng Wang and Yanan Bao and Huizhong Chen and Leonidas Guibas and Vitor Guizilini and Howard Zhou and Yue Wang},
journal= {arXiv preprint arXiv:2511.07416},
year = {2025}
}
备注
Project page: https://pointscoder.github.io/PhysWorld_Web/