中文

返回封顶:基于样本效率的 CVaR 策略梯度优化

机器学习 2025-07-22 v2 人工智能

摘要

在使用策略梯度 (PG) 优化条件价值 at risk (CVaR) 时,当前方法依赖于丢弃大比例轨迹,导致样本效率差。我们提出了一种重新表述 CVaR 优化问题的方法,通过对用于训练的轨迹总回报进行封顶,而非仅仅丢弃它们,展示了这种方法在封顶设置得当时等效于原始问题。我们通过多个环境中的实证结果,表明这种问题的重新表述相对于基线方法 consistently 实现了持续的性能提升。我们已在此处提供了所有代码:https://github.com/HarryMJMead/cvar-return-capping。

关键词

引用

@article{arxiv.2504.20887,
  title  = {Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation},
  author = {Harry Mead and Clarissa Costen and Bruno Lacerda and Nick Hawes},
  journal= {arXiv preprint arXiv:2504.20887},
  year   = {2025}
}