中文

面向风险厌恶强化学习的均值-方差策略迭代

机器学习 2022-04-08 v6 人工智能 机器学习

摘要

我们提出了一种用于折扣无限期 MDP 中风险厌恶控制的均值-方差策略迭代 (MVPI) 框架,旨在优化每步奖励随机变量的方差。MVPI 具有极大的灵活性,任何策略评估方法和风险中性控制方法都可以即插即用地用于同策略和异策略设置下的风险厌恶控制。这种灵活性缩小了风险中性控制与风险厌恶控制之间的差距,并通过直接作用于一种新型增广 MDP 来实现。我们提出了风险厌恶 TD3 作为实例化 MVPI 的示例,在风险感知性能指标下,它在具有挑战性的 Mujoco 机器人仿真任务中优于原始 TD3 和许多先前的风险厌恶控制方法。该风险厌恶 TD3 是首个将确定性策略和异策略学习引入风险厌恶强化学习的方法,这两者都是我们在 Mujoco 领域所展示的性能提升的关键。

关键词

引用

@article{arxiv.2004.10888,
  title  = {Mean-Variance Policy Iteration for Risk-Averse Reinforcement Learning},
  author = {Shangtong Zhang and Bo Liu and Shimon Whiteson},
  journal= {arXiv preprint arXiv:2004.10888},
  year   = {2022}
}

备注

AAAI 2021