风险敏感指数演员-评论家
机器学习
2026-02-10 v1
摘要
模型无监督深度强化学习(RL)算法在一系列具有挑战性的任务上取得了巨大成功。然而,当这些方法部署在实际应用中时,仍存在安全方面的顾虑,导致需要风险感知的智能体。常见的风险度量是指数风险度量,但当前的策略梯度方法优化该度量时必须进行高方差且数值不稳定的更新。因此,现有的风险敏感模型无监督方法局限于简单任务和表格设置。在本文中,我们为针对指数风险度量的策略梯度方法提供了全面的理论依据,包括针对随机和确定性策略设置的on-和off-policy梯度定理。受理论启发,我们提出了风险敏感指数演员-评论家(risk-sensitive exponential actor-critic, rsEAC),这是一种无模型的方法,纳入了新颖的程序来避免指数价值函数及其梯度的显式表示,并优化其策略相对于指数风险度量。我们展示,rsEAC比现有方法产生更数值稳定的更新,能够在MuJoCo中挑战性的风险变体连续任务中可靠地学习风险敏感策略。
引用
@article{arxiv.2602.07202,
title = {Risk-Sensitive Exponential Actor Critic},
author = {Alonso Granados and Jason Pacheco},
journal= {arXiv preprint arXiv:2602.07202},
year = {2026}
}
备注
To appear at AAAI 2026