中文

风险厌恶的离线强化学习

机器学习 2021-02-11 v1

摘要

在高风险应用中训练强化学习(RL)智能体可能因探索相关的风险而过于受限。因此,智能体只能使用由安全策略先前收集的数据。虽然先前的工作考虑利用离线数据优化平均性能,我们专注于优化一种风险厌恶准则,即 CVaR。具体地,我们提出离线风险厌恶 Actor-Critic(O-RAAC),一种在无模型 RL 算法,能够在完全离线设定下学习风险厌恶策略。我们展示了 O-RAAC 在不同机器人控制任务中比风险中性方法学到具有更高 CVaR 的策略。此外,考虑风险厌恶准则可保证平均性能相对于特定分布偏移的分布鲁棒性。我们通过实验证明,在自然分布偏移存在时,O-RAAC 学到了具有良好平均性能的策略。

关键词

引用

@article{arxiv.2102.05371,
  title  = {Risk-Averse Offline Reinforcement Learning},
  author = {Núria Armengol Urpí and Sebastian Curi and Andreas Krause},
  journal= {arXiv preprint arXiv:2102.05371},
  year   = {2021}
}