离线强化学习策略应被训练为自适应的
机器学习
2022-07-06 v1 人工智能
机器学习
摘要
离线强化学习算法必须考虑到其所提供的数据集可能使环境的许多方面未知这一事实。应对这一挑战最常见的方式是采用悲观或保守的方法,避免与训练数据集中的行为过于不同的行为。然而,仅仅依赖保守性存在缺陷:性能对保守程度的具体取值敏感,且保守目标可能恢复出高度次优的策略。在本工作中,我们提出离线强化学习方法应在存在不确定性的情况下保持自适应。我们表明,从贝叶斯意义下在离线强化学习中最优行动涉及求解一个隐式 POMDP。因此,离线强化学习的最优策略必须是自适应的,不仅依赖于当前状态,而是依赖于评估过程中迄今所见的所有转移。我们提出了一种无模型算法来近似该最优自适应策略,并在离线强化学习基准上展示了学习此类自适应策略的有效性。
引用
@article{arxiv.2207.02200,
title = {Offline RL Policies Should be Trained to be Adaptive},
author = {Dibya Ghosh and Anurag Ajay and Pulkit Agrawal and Sergey Levine},
journal= {arXiv preprint arXiv:2207.02200},
year = {2022}
}
备注
ICML 2022 (long talk)