用于提升 CVaR 优化样本效率的简单混合策略参数化
机器学习
2024-07-01 v3 最优化与控制
摘要
利用策略梯度(PG)优化条件风险价值(CVaR)的强化学习算法面临样本效率低下的严峻挑战,阻碍了其实际应用。这种低效性源于两个主要事实:关注尾部表现而忽略了大量采样轨迹,以及当回报分布的下尾过于平坦时可能出现梯度消失。为应对这些挑战,我们提出一种简单的混合策略参数化方法。该方法将风险中性策略与可调策略相结合以构成风险厌恶策略。通过采用这一策略,所有收集到的轨迹均可用于策略更新,同时通过风险中性分量刺激更高回报来抵消梯度消失问题,从而抬升尾部并防止其平坦化。我们的实证研究表明,这种混合参数化在多种基准领域中具有独特的有效性。具体而言,在传统 CVaR-PG 无法学到合理策略的一些 Mujoco 环境中,该方法在识别风险厌恶 CVaR 策略方面表现优异。
引用
@article{arxiv.2403.11062,
title = {A Simple Mixture Policy Parameterization for Improving Sample Efficiency of CVaR Optimization},
author = {Yudong Luo and Yangchen Pan and Han Wang and Philip Torr and Pascal Poupart},
journal= {arXiv preprint arXiv:2403.11062},
year = {2024}
}
备注
RLC 2024