中文

风险敏感强化学习是否已被妥善解决?

机器学习 2025-11-04 v2

摘要

由于在学习可用策略中风险管理的本质,风险敏感强化学习(RSRL)已被认为是一个重要方向。RSRL通常在分布式强化学习框架下,通过学习由各种风险度量刻画的风险敏感目标来实现。然而,就风险度量的意义而言,分布贝尔曼算子是否恰当地优化了RSRL目标仍不清楚。在本文中,我们证明现有的RSRL方法无法实现无偏优化,且无法保证在累积回报分布上关于风险度量的 optimality 甚至改进。为补救该问题,我们进一步提出一种新颖算法,即轨迹Q学习(TQL),用于RSRL问题,并可证明地朝向最优策略进行策略改进。基于我们的新学习架构,我们可自由引入一种通用且实用的实现,以针对不同风险度量学习不同的风险敏感策略。在实验中,我们验证了算法的可学习性,并展示了我们的方法如何有效实现对风险敏感目标的更优性能。

关键词

引用

@article{arxiv.2307.00547,
  title  = {Is Risk-Sensitive Reinforcement Learning Properly Resolved?},
  author = {Ruiwen Zhou and Minghuan Liu and Kan Ren and Xufang Luo and Weinan Zhang and Dongsheng Li},
  journal= {arXiv preprint arXiv:2307.00547},
  year   = {2025}
}