基于 L-infinity Bellman 算子用于 CVaR MDP 的奖励再分配
机器学习
2026-02-04 v1 人工智能
摘要
尾端风险度量,如静态条件价值-at-risk(CVaR),用于安全关键应用以防止罕见但灾难性的事件。与中性风险目标不同,静态 CVaR 的收益取决于整个轨迹,且不允许在 underlying Markov decision process 中进行递归的 Bellman 分解。经典解决方法依赖于包含连续变量的状态增广。然而,除非限制在特定可采纳值函数类,否则该表述会导致稀疏奖励和退化的固定点。在本工作中,我们提出了一种基于增广的静态 CVaR 目标的新 Formulation。我们的替代方法导致一个 Bellman 算子具备:(1)每一步奖励稠密;(2)在完整的有界值函数空间上的收敛性。基于此理论基础,我们开发了风险对抗值迭代和无模型 Q 学习算法,这些算法依赖于离散化的增广状态。我们进一步提供了收敛保证和离散化的近似误差界。实验结果表明,我们的算法成功学习了 CVaR 敏感的政策,并实现了有效的性能-安全权衡。
引用
@article{arxiv.2602.03778,
title = {Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity},
author = {Aneri Muni and Vincent Taboga and Esther Derman and Pierre-Luc Bacon and Erick Delage},
journal= {arXiv preprint arXiv:2602.03778},
year = {2026}
}