基于风险厌恶强化学习的均值-半方差策略优化
机器学习
2023-03-09 v3 人工智能
摘要
在现实世界决策场景中(如金融、机器人、自动驾驶等),控制风险往往比最大化期望回报更为关键。风险度量最自然的选择是方差,其对上行波动与下行波动的惩罚相同。相反,(下行)半方差刻画了随机变量低于其均值的负偏差,更适用于风险厌恶情形。本文旨在针对稳定奖励分布优化强化学习中的均值-半方差(MSV)准则。由于半方差具有时间不一致性且不满足标准Bellman方程,传统动态规划方法无法直接应用于MSV问题。为应对该挑战,我们借助扰动分析(Perturbation Analysis, PA)理论建立了MSV的性能差分公式。我们揭示MSV问题可通过迭代求解一系列具有策略依赖奖励函数的RL问题来得到。进一步,我们基于策略梯度理论与信赖域方法提出了两种同策略算法。最后,我们从简单bandit问题到MuJoCo中的连续控制任务进行了多样化实验,证明了所提方法的有效性。
引用
@article{arxiv.2206.07376,
title = {Mean-Semivariance Policy Optimization via Risk-Averse Reinforcement Learning},
author = {Xiaoteng Ma and Shuai Ma and Li Xia and Qianchuan Zhao},
journal= {arXiv preprint arXiv:2206.07376},
year = {2023}
}
备注
Accecpted by Journal of Artificial Intelligence Research