中文

COptiDICE:基于稳态分布校正估计的离线约束强化学习

机器学习 2022-04-20 v1 人工智能

摘要

我们考虑离线约束强化学习(RL)问题,其中智能体旨在仅从预先收集的数据集中学习,计算一个在最大化期望回报的同时满足给定代价约束的策略。该问题设定在许多真实场景中具有吸引力,其中与环境直接交互代价高昂或存在风险,且所得策略应符合安全约束。然而,在离线RL设定中计算保证满足代价约束的策略具有挑战性,因为离屏策略评估固有地存在估计误差。本文中,我们提出一种在稳态分布空间中优化策略的离线约束RL算法。我们的算法COptiDICE直接估计最优策略相对于回报的稳态分布校正,同时约束代价上界,以期产生用于实际约束满足的代价保守策略。实验结果表明,COptiDICE在约束满足与回报最大化方面获得了更优策略,优于基线算法。

关键词

引用

@article{arxiv.2204.08957,
  title  = {COptiDICE: Offline Constrained Reinforcement Learning via Stationary Distribution Correction Estimation},
  author = {Jongmin Lee and Cosmin Paduraru and Daniel J. Mankowitz and Nicolas Heess and Doina Precup and Kee-Eung Kim and Arthur Guez},
  journal= {arXiv preprint arXiv:2204.08957},
  year   = {2022}
}

备注

24 pages, 6 figures, Accepted at ICLR 2022 (spotlight)