中文

面向累积前景理论的强化学习策略梯度

机器学习 2026-02-18 v4 人工智能

摘要

我们推导了针对累积前景理论(CPT)目标的策略梯度定理,推广了标准策略梯度定理,并将扭曲基风险目标作为特例纳入其中。受行为经济学启发,CPT将围绕参考点的非对称效用转换与概率扭曲相结合。基于我们的定理,我们设计了一个基于顺序统计量的蒙特卡洛梯度估计器的CPT-RL一阶策略梯度算法。我们为估计器提供了统计保证,并证明了所得算法收敛于(通常非凸)CPT目标的的一阶静止点。仿真结果展示了CPT引发的定性行为,并将我们的一阶方法与现有零阶方法进行比较。

关键词

引用

@article{arxiv.2410.02605,
  title  = {Policy Gradients for Cumulative Prospect Theory in Reinforcement Learning},
  author = {Olivier Lepel and Anas Barakat},
  journal= {arXiv preprint arXiv:2410.02605},
  year   = {2026}
}