百导百万:基于专家引导的自适应离线强化学习
机器学习
2023-09-06 v1
摘要
离线强化学习(RL)在预先收集的数据集上优化策略,无需与环境进行任何交互,却通常受困于分布偏移问题。为缓解此问题,一种典型方案是在策略改进目标上施加策略约束。然而,现有方法普遍采用“一刀切”做法,即对整个小批量甚至整个离线数据集中的所有样本仅保持单一的改进—约束平衡。本文中,我们认为不同样本应以不同的策略约束强度对待。基于该思想,提出一种名为引导式离线 RL(GORL)的新型插件式方法。GORL 采用一个引导网络,配合少量专家示范,自适应地确定每个样本在策略改进与策略约束上的相对重要性。我们从理论上证明本方法所提供的引导是合理且近最优的。在多种环境下的广泛实验表明,GORL 可轻松安装于大多数离线 RL 算法上,并取得统计显著的性能提升。
引用
@article{arxiv.2309.01448,
title = {Hundreds Guide Millions: Adaptive Offline Reinforcement Learning with Expert Guidance},
author = {Qisen Yang and Shenzhi Wang and Qihang Zhang and Gao Huang and Shiji Song},
journal= {arXiv preprint arXiv:2309.01448},
year = {2023}
}