中文

面向一般效用强化学习的策略梯度

机器学习 2023-08-30 v2

摘要

在强化学习(RL)中,智能体的目标是发现一种最优策略,以最大化期望累积奖励。该目标也可视为寻找一种优化其状态-动作占据测度的线性函数的策略,以下称为线性 RL。然而,许多监督和无监督 RL 问题未被线性 RL 框架涵盖,例如学徒学习、纯探索和可变性内在控制,其中目标是占据测度的非线性函数。具有非线性效用的 RL 看似难以处理,因为像 Bellman 方程、值迭代、策略梯度、动态规划这些在线性 RL 中取得巨大成功的方法,无法平凡地推广。本文中,我们推导了面向一般效用 RL 的策略梯度定理。策略梯度定理因其优雅性和易实现性而成为线性 RL 的基石。我们面向一般效用 RL 的策略梯度定理具有同样的优雅性和易实现性。基于推导出的策略梯度定理,我们还提出了一种简单的基于采样的算法。我们相信我们的结果会引起社区的兴趣,并为这一广义设定下的未来工作提供启发。

关键词

引用

@article{arxiv.2210.00991,
  title  = {Policy Gradient for Reinforcement Learning with General Utilities},
  author = {Navdeep Kumar and Kaixin Wang and Kfir Levy and Shie Mannor},
  journal= {arXiv preprint arXiv:2210.00991},
  year   = {2023}
}