中文

燃烧 RED:在平均奖励马尔可夫决策过程中解锁子任务驱动的强化学习与风险意识

机器学习 2025-08-29 v11 人工智能

摘要

平均奖励马尔可夫决策过程(MDP)为序列决策在不确定性下的基础框架。然而,平均奖励 MDP 在强化学习(RL)环境中基本未被探索,大多数 RL 基于 effort 都分配给折扣 MDP。本文我们研究了平均奖励 MDP 的一种独特结构属性,并利用它引入奖励扩展微分(或 RED)强化学习:一种 novel RL 框架,可用于在平均奖励 setting 中有效且高效地解决各种学习目标或子任务。我们引入了一系列 RED 学习算法,用于 prediction 和 control,包括针对表格情况的 proven-convergent algorithms。随后,我们通过演示如何使用这些算法来学习一个政策,首次在 fully-online manner 中优化众所周知的条件价值风险(CVaR)风险 measure,而无需使用显式的双层优化方案或增强 state-space。

关键词

引用

@article{arxiv.2410.10578,
  title  = {Burning RED: Unlocking Subtask-Driven Reinforcement Learning and Risk-Awareness in Average-Reward Markov Decision Processes},
  author = {Juan Sebastian Rojas and Chi-Guhn Lee},
  journal= {arXiv preprint arXiv:2410.10578},
  year   = {2025}
}

备注

In Reinforcement Learning Journal 2025