中文

ENOTO:利用 Q 集成改进离线到在线强化学习

机器学习 2024-07-23 v4 人工智能 机器人学

摘要

离线强化学习(RL)是一种智能体从固定的经验数据集中学习的学习范式。然而,仅从静态数据集学习会因缺乏探索而限制性能。为了克服这一点,离线到在线 RL 将离线预训练与在线微调相结合,使智能体能够通过与环境的实时交互进一步完善其策略。尽管有其优点,现有的离线到在线 RL 方法在在线阶段仍遭受性能下降和提升缓慢的问题。为了应对这些挑战,我们提出了一种名为基于集成的离线到在线(ENOTO)RL 的新框架。通过增加 Q 网络的数量,我们无缝地衔接了离线预训练和在线微调,而不会降低性能。此外,为了加速在线性能提升,我们适当地放松了 Q 值估计的悲观性,并将基于集成的探索机制纳入我们的框架。实验结果表明,在一系列运动和导航任务中,ENOTO 能够显著提高现有离线 RL 方法在在线微调期间的训练稳定性、学习效率和最终性能,显著优于现有的离线到在线 RL 方法。

关键词

引用

@article{arxiv.2306.06871,
  title  = {ENOTO: Improving Offline-to-Online Reinforcement Learning with Q-Ensembles},
  author = {Kai Zhao and Jianye Hao and Yi Ma and Jinyi Liu and Yan Zheng and Zhaopeng Meng},
  journal= {arXiv preprint arXiv:2306.06871},
  year   = {2024}
}