基于模型的强化学习中跨任务迁移的可行性研究
机器学习
2023-06-16 v2 计算机视觉与模式识别
机器人学
摘要
强化学习(RL)算法可以直接从图像观测中解决具有挑战性的控制问题,但通常需要进行数百万次环境交互才能做到。近来,基于模型的RL算法通过同时学习内部世界模型,并以想象中的rollout补充真实环境交互来改进策略,大幅提升了样本效率。然而,从零开始学习有效的世界模型十分困难,且与人类严重依赖世界理解和视觉线索来学习新技能形成鲜明对比。在这项工作中,我们研究现代基于模型的RL算法学到的内部模型是否可被用来更快地解决新的、明显不同的任务。我们提出基于模型的跨任务迁移(XTRA),一种通过对学到的世界模型进行可扩展预训练和微调来实现样本高效在线RL的框架。通过离线多任务预训练和在线跨任务微调,我们相比从零训练的基线取得了实质性改进;我们将基于模型的算法EfficientZero的平均性能提升了23%,在某些实例中提升高达71%。
引用
@article{arxiv.2210.10763,
title = {On the Feasibility of Cross-Task Transfer with Model-Based Reinforcement Learning},
author = {Yifan Xu and Nicklas Hansen and Zirui Wang and Yung-Chieh Chan and Hao Su and Zhuowen Tu},
journal= {arXiv preprint arXiv:2210.10763},
year = {2023}
}
备注
Project page with code: https://nicklashansen.github.io/xtra