全局强化学习:通过亚调和半梯度方法超越线性和凸奖励
机器学习
2024-07-16 v1
摘要
在经典强化学习(RL)中,智能体最大化访问状态的可加目标,例如价值函数。不幸的是,这类目标无法建模诸如实验设计、探索、模仿学习以及风险规避RL等许多现实世界应用,这是因为可加目标忽略了对状态之间相互作用的考虑,这些相互作用对于某些任务至关重要。为解决此问题,我们引入了全局强化学习(GRL),其中奖励是相对于轨迹而非相对于状态来定义的。全局奖励可以通过亚调函数捕获状态之间的负相互作用,例如在探索中,而通过超调函数捕获正相互作用,例如协同效应,同时通过它们的组合来捕获混合相互作用。通过利用亚调优化的思想,我们提出了一种新的算法方案,将任何GRL问题转换为一系列经典RL问题,并通过曲率依赖的近似保证有效求解。我们还提供了近似结果的困难性,并在几个GRL实例上实证演示了我们方法的有效性。
引用
@article{arxiv.2407.09905,
title = {Global Reinforcement Learning: Beyond Linear and Convex Rewards via Submodular Semi-gradient Methods},
author = {Riccardo De Santi and Manish Prajapat and Andreas Krause},
journal= {arXiv preprint arXiv:2407.09905},
year = {2024}
}
备注
ICML 2024