基于离线数据的元学习目标增强在线强化学习
机器学习
2025-01-14 v1
摘要
强化学习(RL)中从稀疏奖励中学习最优策略是一个主要挑战。先前的工作通过手工制作的辅助目标来增强常规模仿学习(IL),但以牺牲RL策略次优为代价,当离线数据由非专家策略生成时。相反,为了更好地利用离线数据中的宝贵信息,我们开发了 Generalized Imitation Learning from Demonstration(GILD),该方法通过元学习从离线数据中提炼知识,并在内在动机上塑造对最优策略的理解。与针对特定RL算法的先前工作不同,GILD 是一个灵活的模块,旨在适用于多种基础离策略RL算法。此外,GILD 不引入领域特定的超参数,也最小化了计算成本的增加。在四个具有稀疏奖励的 MuJoCo 任务中,我们展示了三个增强了GILD的RL算法显著优于最先进的方法。
引用
@article{arxiv.2501.07346,
title = {Enhancing Online Reinforcement Learning with Meta-Learned Objective from Offline Data},
author = {Shilong Deng and Zetao Zheng and Hongcai He and Paul Weng and Jie Shao},
journal= {arXiv preprint arXiv:2501.07346},
year = {2025}
}
备注
Accepted by AAAI 2025 (this version includes supplementary material)