次模强化学习
机器学习
2024-05-27 v2
摘要
在强化学习(RL)中,状态的奖励通常被认为是可加的,并且遵循马尔可夫假设,它们与先前访问过的状态。在许多重要应用中,例如覆盖控制、实验设计和信息路径规划,奖励天然具有收益递减特性,即其价值在考虑到先前访问过的相似状态时会降低。为此,我们提出(SubRL),这是一种寻求优化更一般的、非可加(且依赖于历史)奖励的范式,这些奖励通过捕捉收益递减的次模集合函数来建模。遗憾的是,一般而言,即使在表格设定下,我们也证明由此产生的优化问题难以近似求解。另一方面,受经典次模优化中贪心算法成功的启发,我们提出 SubPO,一种基于策略梯度的简单 SubRL 算法,它通过贪心最大化边际增益来处理非可加奖励。事实上,在底层马尔可夫决策过程(MDP)的某些假设下,SubPO 可恢复次模赌博机的最优常数因子近似。此外,我们推导出一种自然的策略梯度方法,用于即使在大型状态和动作空间中也能局部优化 SubRL 实例。我们通过将 SubPO 应用于若干应用(如生物多样性监测、贝叶斯实验设计、信息路径规划和覆盖最大化)来展示我们方法的通用性。我们的结果表明了样本效率以及对高维状态-动作空间的可扩展性。
引用
@article{arxiv.2307.13372,
title = {Submodular Reinforcement Learning},
author = {Manish Prajapat and Mojmír Mutný and Melanie N. Zeilinger and Andreas Krause},
journal= {arXiv preprint arXiv:2307.13372},
year = {2024}
}
备注
Spotlight paper at ICLR 2024