通过轨迹加权利用混合离线强化学习数据集
机器学习
2023-06-23 v1 人工智能
摘要
大多数离线强化学习(RL)算法返回一个目标策略,该策略最大化以下两者的权衡:(1) 收集数据集的行为策略上的期望性能增益,以及 (2) 由所诱导状态-动作占用分布的分布外程度带来的风险。由此可知,目标策略的性能与行为策略的性能密切相关,从而也与数据集的轨迹回报分布密切相关。我们表明,在由大部分低回报轨迹和少量高回报轨迹组成的混合数据集中,最先进的离线 RL 算法受到低回报轨迹的过度约束,无法充分利用高性能轨迹。为克服此问题,我们证明在具有随机初始状态的确定性 MDP 中,可以对数据集采样重新加权,以诱导出一个行为策略具有更高回报的人工数据集。该重新加权采样策略可与任意离线 RL 算法结合。我们进一步分析得出,相对于行为策略的性能改进机会与数据集中轨迹回报的正向方差相关。我们通过实验表明,尽管 CQL、IQL 和 TD3+BC 仅实现了这部分潜在策略改进的一部分,但将这些算法与我们的重加权采样策略结合后可充分利用数据集。此外,我们通过实验证明,尽管存在理论局限,该方法在随机环境中仍可能有效。代码见 https://github.com/Improbable-AI/harness-offline-rl。
引用
@article{arxiv.2306.13085,
title = {Harnessing Mixed Offline Reinforcement Learning Datasets via Trajectory Weighting},
author = {Zhang-Wei Hong and Pulkit Agrawal and Rémi Tachet des Combes and Romain Laroche},
journal= {arXiv preprint arXiv:2306.13085},
year = {2023}
}