在真实世界中微调离线世界模型
机器学习
2023-10-25 v1 人工智能
计算机视觉与模式识别
机器人学
摘要
强化学习(RL)以数据效率低而著称,这使得在真实机器人上训练十分困难。虽然基于模型的 RL 算法(世界模型)在一定程度上提高了数据效率,但它们仍需数小时或数天的交互来学习技能。近来,离线 RL 被提出作为一种在不进行任何在线交互的情况下基于预存数据集训练 RL 策略的框架。然而,将算法限制于固定数据集会导致训练与推理之间的状态-动作分布偏移,并限制其对新任务的适用性。在这项工作中,我们力求兼得二者之长:我们考虑先用真实机器人上收集的离线数据预训练世界模型,然后通过用所学模型进行规划所收集的在线数据对模型进行微调。为减轻在线交互期间的外推误差,我们提出在测试时通过平衡估计回报与(认知)模型不确定性来正则化规划器。我们在仿真和真实机器人的多种视觉-运动控制任务上评估了我们的方法,发现即使离线数据有限,我们的方法也能实现对已见和未见任务的少样本微调。视频、代码和数据可在 https://yunhaifeng.com/FOWM 获取。
引用
@article{arxiv.2310.16029,
title = {Finetuning Offline World Models in the Real World},
author = {Yunhai Feng and Nicklas Hansen and Ziyan Xiong and Chandramouli Rajagopalan and Xiaolong Wang},
journal= {arXiv preprint arXiv:2310.16029},
year = {2023}
}
备注
CoRL 2023 Oral; Project website: https://yunhaifeng.com/FOWM