通过预测世界建模提升生成式机器人策略的推理时性能
机器人学
2026-03-13 v4 计算机视觉与模式识别
机器学习
摘要
我们提出了生成式预测控制(GPC),这是一种在推理时改进预训练行为克隆策略的方法,而无需重新训练。GPC 通过在专家演示和随机探索 rollout 上训练的以动作为条件的世界模型来增强冻结的扩散策略在部署时的性能。该世界模型预测由扩散策略生成的动作提议的后果,并通过基于模型的前瞻规划对这些提议进行排序和细化。通过将生成式先验与预测式前瞻相结合,GPC 实现了在保持原始策略固定的测试时适应。跨越多种机器人操控任务,包括模拟和真实世界中的状态和视觉基环境,GPC 均一致优于标准行为克隆,并与其他推理时适应基线方法相当。
引用
@article{arxiv.2502.00622,
title = {Inference-Time Enhancement of Generative Robot Policies via Predictive World Modeling},
author = {Han Qi and Haocheng Yin and Aris Zhu and Yilun Du and Heng Yang},
journal= {arXiv preprint arXiv:2502.00622},
year = {2026}
}
备注
Acceptance to IEEE Robotics and Automation Letters. Website: https://computationalrobotics.seas.harvard.edu/GPC