中文

ACReL:对抗式条件风险价值强化学习

机器学习 2022-05-19 v2

摘要

在经典强化学习(RL)设定中,目标是找到使期望回报最大化的策略。该目标在医疗或自动驾驶等安全关键领域可能并不合适,因为随机策略与环境变化带来的内在不确定性可能导致灾难性失败。这可以通过使用条件风险价值(CVaR)目标来使所学策略具备风险规避性。本文提出对抗式CVaR强化学习(ACReL),一种用于在RL中优化CVaR目标的新型对抗式元算法。ACReL基于策略方与给定有限预算扰动策略方状态转移的所学对抗方之间的极大极小博弈。我们证明,博弈双方越接近博弈均衡点,所学策略就越接近CVaR最优策略,其风险容忍度与对抗方预算显式相关。我们提供一种基于梯度的训练流程,通过将该博弈表述为Stackelberg博弈来求解,从而可使用深度RL架构与训练算法。实证实验表明,ACReL在恢复CVaR最优策略方面与CVaR RL的SOTA基线相当,同时还具备理论保证。

关键词

引用

@article{arxiv.2109.09470,
  title  = {ACReL: Adversarial Conditional value-at-risk Reinforcement Learning},
  author = {M. Godbout and M. Heuillet and S. Chandra and R. Bhati and A. Durand},
  journal= {arXiv preprint arXiv:2109.09470},
  year   = {2022}
}