面向动态期望分位和条件价值 at-risk 的 Actor-Critic 算法
机器学习
2026-05-11 v1
摘要
在随机策略下优化动态风险在策略更新和价值学习方面都具有挑战性。前者通常需要转换扰动,而后者可能依赖基于模型的方法。为此,我们提出一种无需转换扰动的代理策略梯度,并采用 softmax 策略参数化。我们进一步发展了针对动态期望分位和条件价值 at-risk 的 model-free 价值学习方法,利用可暴露性 (elicitability)。最后,灵感来自 Expected SARSA 和 Expected Policy Gradient,我们构建了一个 model-free 的 off-policy actor-critic 算法。在表现可验证的风险厌恶行为的领域中的实证结果表明,我们的算法能够学习风险厌恶策略,并持续优于其他现有方法。
引用
@article{arxiv.2605.07857,
title = {Actor-Critic Algorithm for Dynamic Expectile and CVaR},
author = {Yudong Luo and Erick Delage},
journal= {arXiv preprint arXiv:2605.07857},
year = {2026}
}