基于坚特利上界的值-at-risk约束策略优化
机器学习
2026-05-01 v3 机器学习
摘要
我们提出了值-at风险约束策略优化算法(VaR-CPO),这是一种样本高效且保守的方法,用于优化值-at风险(VaR)约束的强化学习(RL)问题。我们实际上表明,VaR-CPO能够实现安全探索,在可行环境中实现训练期间零约束违规,这一特性是基线方法难以实现的。为克服VaR约束固有的不可微性,我们采用坚特利不等式获得基于成本回报前两个时刻的可计算近似。此外,通过扩展受约束策略优化(CPO)方法的信任区域框架,我们为训练过程中的策略改进和约束违规提供了最坏情况界限。
引用
@article{arxiv.2601.22993,
title = {Constrained Policy Optimization with Cantelli-Bounded Value-at-Risk},
author = {Rohan Tangri and Jan-Peter Calliess},
journal= {arXiv preprint arXiv:2601.22993},
year = {2026}
}