中文

保守离线分布强化学习

机器学习 2021-10-28 v2

摘要

实践中许多强化学习(RL)问题是离线的,即纯粹从观测数据中学习。一个关键挑战是如何确保所学策略的安全性,这需要对不同动作相关的风险进行量化。在线设置中,分布强化学习算法通过学习方法回报(即累积奖励)的分布而非期望回报来实现这一点;除量化风险外,它们还被证明能为规划学习更好的表征。我们提出保守离线分布 Actor-Critic(CODAC),一种适用于风险中性和风险厌恶领域的离线 RL 算法。CODAC 通过对分布外动作的回报预测分位数进行惩罚,将分布强化学习适配到离线设置中。我们证明 CODAC 学习到保守的回报分布——特别地,对于有限 MDP,CODAC 收敛到回报分布分位数的统一下界;我们的证明依赖于对分布 Bellman 算子的新颖分析。在实验中,在两个具有挑战性的机器人导航任务上,CODAC 仅使用从风险中性智能体收集的离线数据就成功学到了风险厌恶策略。此外,在 D4RL MuJoCo 基准上,CODAC 在期望性能和风险敏感性能方面均达到最先进水平。

关键词

引用

@article{arxiv.2107.06106,
  title  = {Conservative Offline Distributional Reinforcement Learning},
  author = {Yecheng Jason Ma and Dinesh Jayaraman and Osbert Bastani},
  journal= {arXiv preprint arXiv:2107.06106},
  year   = {2021}
}

备注

NeurIPS 2021