中文

OptiDICE:通过稳态分布校正估计进行离线策略优化

机器学习 2021-06-22 v1 人工智能

摘要

我们考虑离线强化学习(RL)设定,其中智能体旨在仅从数据中优化策略而无需进一步与环境交互。在离线 RL 中,分布偏移成为困难的主要来源,它源于待优化目标策略与用于数据收集的行为策略之间的偏离。这通常导致动作价值的高估,对使用自举的无模型算法造成严重问题。为缓解该问题,先前的离线 RL 算法常使用复杂技术来鼓励动作价值的低估,这引入了一组需要恰当调优的额外超参数。本文中,我们提出一种以更原则性方式防止高估的离线 RL 算法。我们的算法 OptiDICE 直接估计最优策略的稳态分布校正,并且不像先前的离线 RL 算法那样依赖于策略梯度。使用一套广泛的离线 RL 基准数据集,我们表明 OptiDICE 与最先进的方法相比具有竞争力。

关键词

引用

@article{arxiv.2106.10783,
  title  = {OptiDICE: Offline Policy Optimization via Stationary Distribution Correction Estimation},
  author = {Jongmin Lee and Wonseok Jeon and Byung-Jun Lee and Joelle Pineau and Kee-Eung Kim},
  journal= {arXiv preprint arXiv:2106.10783},
  year   = {2021}
}

备注

26 pages, 11 figures, Accepted at ICML 2021