何时信任你的模拟器:动力学感知的混合离线-在线强化学习
机器学习
2025-10-16 v4 人工智能
摘要
在没有高保真仿真环境的情况下,学习有效的强化学习(RL)策略以解决现实世界复杂任务可能极具挑战性。在大多数情况下,我们仅被给予具有简化动力学的非完美模拟器,这不可避免地导致RL策略学习中严重的仿真到现实的差距。近期兴起的离线RL领域提供了另一种直接从预收集历史数据学习策略的可能性。然而,为实现合理性能,现有离线RL算法需要 impractical 的大型离线数据,且需具备充分的状态-动作空间覆盖以进行训练。这引出了一个新问题:是否可能将离线RL中从有限真实数据学习与在线RL中通过非完美模拟器的无限制探索相结合,以弥补两种方法的缺陷?在本研究中,我们提出动力学感知的混合离线-在线强化学习(H2O)框架,对这一问题给出肯定回答。H2O引入了一种动力学感知的策略评估方案,该方案自适应地惩罚具有大动力学差距的模拟状态-动作对上的Q函数学习,同时允许从固定的真实世界数据集学习。通过大量仿真与真实世界任务以及理论分析,我们展示了H2O相对于其他跨域在线与离线RL算法的优越性能。H2O提供了一种全新的混合离线-在线RL范式,有望为未来解决实际现实世界任务的RL算法设计提供启示。
引用
@article{arxiv.2206.13464,
title = {When to Trust Your Simulator: Dynamics-Aware Hybrid Offline-and-Online Reinforcement Learning},
author = {Haoyi Niu and Shubham Sharma and Yiwen Qiu and Ming Li and Guyue Zhou and Jianming Hu and Xianyuan Zhan},
journal= {arXiv preprint arXiv:2206.13464},
year = {2025}
}
备注
NeurIPS 2022 Spotlight