中文

基于离线数据的元学习目标增强在线强化学习

机器学习 2025-01-14 v1

摘要

强化学习(RL)中从稀疏奖励中学习最优策略是一个主要挑战。先前的工作通过手工制作的辅助目标来增强常规模仿学习(IL),但以牺牲RL策略次优为代价,当离线数据由非专家策略生成时。相反,为了更好地利用离线数据中的宝贵信息,我们开发了 Generalized Imitation Learning from Demonstration(GILD),该方法通过元学习从离线数据中提炼知识,并在内在动机上塑造对最优策略的理解。与针对特定RL算法的先前工作不同,GILD 是一个灵活的模块,旨在适用于多种基础离策略RL算法。此外,GILD 不引入领域特定的超参数,也最小化了计算成本的增加。在四个具有稀疏奖励的 MuJoCo 任务中,我们展示了三个增强了GILD的RL算法显著优于最先进的方法。

关键词

引用

@article{arxiv.2501.07346,
  title  = {Enhancing Online Reinforcement Learning with Meta-Learned Objective from Offline Data},
  author = {Shilong Deng and Zetao Zheng and Hongcai He and Paul Weng and Jie Shao},
  journal= {arXiv preprint arXiv:2501.07346},
  year   = {2025}
}

备注

Accepted by AAAI 2025 (this version includes supplementary material)