返回封顶:基于样本效率的 CVaR 策略梯度优化
机器学习
2025-07-22 v2 人工智能
摘要
在使用策略梯度 (PG) 优化条件价值 at risk (CVaR) 时,当前方法依赖于丢弃大比例轨迹,导致样本效率差。我们提出了一种重新表述 CVaR 优化问题的方法,通过对用于训练的轨迹总回报进行封顶,而非仅仅丢弃它们,展示了这种方法在封顶设置得当时等效于原始问题。我们通过多个环境中的实证结果,表明这种问题的重新表述相对于基线方法 consistently 实现了持续的性能提升。我们已在此处提供了所有代码:https://github.com/HarryMJMead/cvar-return-capping。
关键词
引用
@article{arxiv.2504.20887,
title = {Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation},
author = {Harry Mead and Clarissa Costen and Bruno Lacerda and Nick Hawes},
journal= {arXiv preprint arXiv:2504.20887},
year = {2025}
}