通过分位梯度提升 CVaR 策略优化
机器学习
2026-02-06 v2
摘要
使用策略梯度(即 CVaR-PG)优化条件价值风险(CVaR)面临显著的样本效率挑战。这一不效率源于其关注尾部端性能并忽视许多抽样轨迹。我们通过引入期望分位项来增强 CVaR 以解决此问题。分位优化采用动态编程公式,可利用所有抽样数据,从而提高样本效率。这并不会改变 CVaR 目标,因为 CVaR 对应于尾部分位的期望。在具有可验证风险厌恶行为的领域中,实验结果表明,我们的算法在马尔可夫策略类中显著优于 CVaR-PG 并 consistently 优于其他现有方法。
引用
@article{arxiv.2601.22100,
title = {Boosting CVaR Policy Optimization with Quantile Gradients},
author = {Yudong Luo and Erick Delage},
journal= {arXiv preprint arXiv:2601.22100},
year = {2026}
}