面向一般效用强化学习的策略梯度
机器学习
2023-08-30 v2
摘要
在强化学习(RL)中,智能体的目标是发现一种最优策略,以最大化期望累积奖励。该目标也可视为寻找一种优化其状态-动作占据测度的线性函数的策略,以下称为线性 RL。然而,许多监督和无监督 RL 问题未被线性 RL 框架涵盖,例如学徒学习、纯探索和可变性内在控制,其中目标是占据测度的非线性函数。具有非线性效用的 RL 看似难以处理,因为像 Bellman 方程、值迭代、策略梯度、动态规划这些在线性 RL 中取得巨大成功的方法,无法平凡地推广。本文中,我们推导了面向一般效用 RL 的策略梯度定理。策略梯度定理因其优雅性和易实现性而成为线性 RL 的基石。我们面向一般效用 RL 的策略梯度定理具有同样的优雅性和易实现性。基于推导出的策略梯度定理,我们还提出了一种简单的基于采样的算法。我们相信我们的结果会引起社区的兴趣,并为这一广义设定下的未来工作提供启发。
引用
@article{arxiv.2210.00991,
title = {Policy Gradient for Reinforcement Learning with General Utilities},
author = {Navdeep Kumar and Kaixin Wang and Kfir Levy and Shie Mannor},
journal= {arXiv preprint arXiv:2210.00991},
year = {2023}
}