M$^3$PC:基于预训练掩码轨迹模型的测试时模型预测控制
机器学习
2025-02-07 v2 机器人学
系统与控制
系统与控制
摘要
无线强化学习(Offline Reinforcement Learning, RL)的最新研究表明,基于掩码自编码目标训练的统一Transformer能够有效捕捉轨迹数据集中不同模态(如状态、动作、奖励)之间的关系。然而,这些信息在推断阶段尚未被充分利用,即智能体需要生成最优政策而不仅仅是重构被掩码的组件。鉴于预训练的轨迹模型可充当具有适当掩码模式下的政策模型和世界模型,我们提出在测试时使用模型预测控制(Model Predictive Control, MPC)来利用模型自身的预测能力指导其动作选择。在D4RL和RoboMimic上的实验结果表明,我们的推断阶段MPC显著提升了预训练轨迹模型的决策性能,且无需任何额外参数训练。此外,我们的框架可适用于无线到在线(Offline to Online, O2O)RL和目标到达RL,提供在线交互预算时更大的性能提升,并在指定不同任务目标时实现更好的泛化能力。代码已公开:https://github.com/wkh923/m3pc。
引用
@article{arxiv.2412.05675,
title = {M$^3$PC: Test-time Model Predictive Control for Pretrained Masked Trajectory Model},
author = {Kehan Wen and Yutong Hu and Yao Mu and Lei Ke},
journal= {arXiv preprint arXiv:2412.05675},
year = {2025}
}
备注
ICLR 2025