中文

基于坚特利上界的值-at-risk约束策略优化

机器学习 2026-05-01 v3 机器学习

摘要

我们提出了值-at风险约束策略优化算法(VaR-CPO),这是一种样本高效且保守的方法,用于优化值-at风险(VaR)约束的强化学习(RL)问题。我们实际上表明,VaR-CPO能够实现安全探索,在可行环境中实现训练期间零约束违规,这一特性是基线方法难以实现的。为克服VaR约束固有的不可微性,我们采用坚特利不等式获得基于成本回报前两个时刻的可计算近似。此外,通过扩展受约束策略优化(CPO)方法的信任区域框架,我们为训练过程中的策略改进和约束违规提供了最坏情况界限。

关键词

引用

@article{arxiv.2601.22993,
  title  = {Constrained Policy Optimization with Cantelli-Bounded Value-at-Risk},
  author = {Rohan Tangri and Jan-Peter Calliess},
  journal= {arXiv preprint arXiv:2601.22993},
  year   = {2026}
}