H2O+:一种改进的动态差异混合离线与在线强化学习框架
机器学习
2025-04-17 v2 人工智能
机器人学
摘要
在不具备高保真仿真环境或大量离线数据的情况下,使用强化学习(RL)解决现实世界复杂任务颇具挑战。在不完美仿真环境中训练的在线 RL 智能体可能遭受严重的仿真到现实(sim-to-real)问题。离线 RL 方法虽绕开了仿真器的需求,却往往对离线数据集的规模与质量有严苛要求。近期出现的混合离线与在线 RL 提供了一种颇具吸引力的框架,能够联合利用有限离线数据与不完美仿真器进行可迁移策略学习。本文提出一种称为 H2O+ 的新算法,其具备高度灵活性以衔接各类离线与在线学习方法的组合,同时考虑了真实环境与仿真环境之间的动态差异(dynamics gap)。通过大量仿真与真实机器人实验,我们展示了相较先进的跨域在线与离线 RL 算法更优的性能与灵活性。
引用
@article{arxiv.2309.12716,
title = {H2O+: An Improved Framework for Hybrid Offline-and-Online RL with Dynamics Gaps},
author = {Haoyi Niu and Tianying Ji and Bingqi Liu and Haocheng Zhao and Xiangyu Zhu and Jianying Zheng and Pengfei Huang and Guyue Zhou and Jianming Hu and Xianyuan Zhan},
journal= {arXiv preprint arXiv:2309.12716},
year = {2025}
}
备注
ICRA 2025