中文

改进基于潜在的奖励塑形在强化学习中的有效性

机器学习 2025-02-04 v1

摘要

基于潜在的奖励塑形在强化学习中常用于纳入解决任务的先验知识,因为它能够形式保证策略不变性。因此,最优策略以及由策略收益排序后的策略顺序均不会被基于潜在的奖励塑形所改变。本文指出,有效的基于潜在的奖励塑形依赖于初始Q值和外部奖励,这决定了智能体利用塑形奖励引导其探索并提高样本效率的能力。我们形式地推导了如何通过对潜在函数进行简单的线性偏移来提高奖励塑形的有效性,而无需改变潜在函数中编码的偏好,亦无需调整初始Q值——后者在深度强化学习中可能具有挑战性且不希望更改。我们展示了连续潜在函数在正确分配正负奖励塑形值方面的理论局限性。我们在稀疏且信息不足的奖励函数下的网格世界域以及Cart Pole和Mountain Car环境中对现实发现进行了实证验证,并展示了在深度强化学习中运用这些结果的可能性。

关键词

引用

@article{arxiv.2502.01307,
  title  = {Improving the Effectiveness of Potential-Based Reward Shaping in Reinforcement Learning},
  author = {Henrik Müller and Daniel Kudenko},
  journal= {arXiv preprint arXiv:2502.01307},
  year   = {2025}
}

备注

9 pages, 4 figures, accepted as extended abstract at AAMAS 2025