中文

面向在线与离线强化学习的风险敏感Actor-Critic方法——基于静态光谱风险度量

机器学习 2025-07-08 v1 机器学习

摘要

分布式强化学习(Distributional Reinforcement Learning,DRL)的发展,引入了一种自然的方式,通过在价值函数中采用除期望值之外的风险度量,来纳入风险敏感性。虽然这种方法在许多在线和离线RL算法中由于其简单性而被广泛采用,但对风险度量的简单集成常常导致次优政策。这种限制在风险敏感政策至关重要且最坏情况结果具有严重后果的场景中尤其为害人。为此,我们提出了一种用于优化静态光谱风险度量(Spectral Risk Measures,SRM)的新型框架,这是一族灵活的风险度量,概括了诸如CVaR和Mean-CVaR等目标,并可用于调整风险偏好。我们的方法适用于两种在线和离线RL算法。此外,我们通过严格的理论分析,在有限状态动作环境中证明了收敛性。更重要的是,通过大量实验评估,我们展示了我们的算法在多种领域中,无论是线上还是线下环境,都一致优于现有风险敏感方法。

关键词

引用

@article{arxiv.2507.03900,
  title  = {Risk-sensitive Actor-Critic with Static Spectral Risk Measures for Online and Offline Reinforcement Learning},
  author = {Mehrdad Moghimi and Hyejin Ku},
  journal= {arXiv preprint arXiv:2507.03900},
  year   = {2025}
}