基于动作依赖性的保最优性奖励整形方法
机器学习
2025-05-20 v1
摘要
近期强化学习研究利用奖励整形——尤其是复杂的奖励整形如内在动机(IM)——以鼓励稀疏奖励环境中的智能体探索。虽然此类方法常备有效,但“奖励破坏”可能导致整形奖励在牺牲外部奖励的情况下被优化,从而导致次优政策。潜在基准奖励整形(PBRS)技术,如广义奖励匹配(GRM)和策略不变显式整形(PIES)已有所缓解。这类方法允许在不改变最优政策的前提下实施 IM。本文指出,这些方法实际上不适用于具有复杂探索需求且包含长时程 episode 的环境。为此,我们引入基于动作依赖性的保最优性奖励整形(ADOPS)方法,将内在奖励转换为一种可保持最优性的形式,使智能体在极度稀疏的 Montezuma's Revenge 环境中更有效地利用 IM。我们还证明 ADOPS 能够容纳无法用潜在形式表示的奖励整形函数:虽然 PBRS 方法要求累积折扣内在回报独立于动作,但 ADOPS 允许内在累积回报依赖于智能体的动作,而仍保持最优政策集合的不变性。我们展示了动作依赖性如何使 ADOPS 在其他方法难以应对的复杂稀疏奖励环境中保持保最优性。
引用
@article{arxiv.2505.12611,
title = {Action-Dependent Optimality-Preserving Reward Shaping},
author = {Grant C. Forbes and Jianxun Wang and Leonardo Villalobos-Arias and Arnav Jhala and David L. Roberts},
journal= {arXiv preprint arXiv:2505.12611},
year = {2025}
}
备注
Extended abstract at AAMAS 2025; full paper at ICML 2025