基于潜在的内在动机:保持复杂非马尔可夫塑形奖励的最优性
机器学习
2024-10-17 v1
摘要
最近出现了大量用于在复杂稀疏奖励环境中学习的内在动机(IM)奖励塑形方法。这些方法常常会意外改变环境中最优政策的集合,导致次优行为。通过潜在基于奖励塑形(PBRS)等方法来缓解奖励塑形风险的以往工作并不适用于许多 IM 方法,因为它们通常是复杂的可训练函数,因而依赖于比 PBRS 所针对的传统奖励函数更广泛的变量集合。我们提出了对 PBRS 的一个扩展,证明了在比以前已证明的更广泛的函数集合下仍能保持最优政策的集合。我们还提出了基于潜在的内在动机(PBIM)和通用奖励匹配(GRM),将 IM 奖励转换为潜在基于形式的方法,这些方法在不改变最优政策集合的前提下可用。通过在 MiniGrid DoorKey 和 Cliff Walking 环境中进行测试,我们证明 PBIM 和 GRM 成功地防止了代理人收敛到次优政策,并且可以加快训练。此外,我们证明 GRM 足够通用,以涵盖所有潜在基于奖励塑形函数。这篇论文扩展了之前引入 PBIM 方法的工作,并为更通用的方法 GRM 提供了扩展,以及额外的证明、实验结果和讨论。
引用
@article{arxiv.2410.12197,
title = {Potential-Based Intrinsic Motivation: Preserving Optimality With Complex, Non-Markovian Shaping Rewards},
author = {Grant C. Forbes and Leonardo Villalobos-Arias and Jianxun Wang and Arnav Jhala and David L. Roberts},
journal= {arXiv preprint arXiv:2410.12197},
year = {2024}
}
备注
To be submit to joint AIJ-JAIR special track for award-winning papers. arXiv admin note: substantial text overlap with arXiv:2402.07411