中文

基于风险厌恶强化学习的均值-半方差策略优化

机器学习 2023-03-09 v3 人工智能

摘要

在现实世界决策场景中(如金融、机器人、自动驾驶等),控制风险往往比最大化期望回报更为关键。风险度量最自然的选择是方差,其对上行波动与下行波动的惩罚相同。相反,(下行)半方差刻画了随机变量低于其均值的负偏差,更适用于风险厌恶情形。本文旨在针对稳定奖励分布优化强化学习中的均值-半方差(MSV)准则。由于半方差具有时间不一致性且不满足标准Bellman方程,传统动态规划方法无法直接应用于MSV问题。为应对该挑战,我们借助扰动分析(Perturbation Analysis, PA)理论建立了MSV的性能差分公式。我们揭示MSV问题可通过迭代求解一系列具有策略依赖奖励函数的RL问题来得到。进一步,我们基于策略梯度理论与信赖域方法提出了两种同策略算法。最后,我们从简单bandit问题到MuJoCo中的连续控制任务进行了多样化实验,证明了所提方法的有效性。

关键词

引用

@article{arxiv.2206.07376,
  title  = {Mean-Semivariance Policy Optimization via Risk-Averse Reinforcement Learning},
  author = {Xiaoteng Ma and Shuai Ma and Li Xia and Qianchuan Zhao},
  journal= {arXiv preprint arXiv:2206.07376},
  year   = {2023}
}

备注

Accecpted by Journal of Artificial Intelligence Research