中文

自举奖励塑形

机器学习 2025-07-28 v2 人工智能

摘要

在强化学习中,尤其是在稀疏奖励领域,需要许多环境步骤才能观察到奖励信息。为了提高此类观察的频率,已提出“基于势函数的奖励塑形”(PBRS)作为一种提供更密集奖励信号同时保持最优策略不变的方法。然而,所需的“势函数”必须利用任务相关知识进行仔细设计,以免损害训练性能。在本工作中,我们提出了一种“自举”的奖励塑形方法,称为 BSRS,其中智能体对状态值函数的当前估计充当 PBRS 的势函数。我们提供了表格设置下的收敛证明,深入分析了深度强化学习的训练动态,并表明所提方法提高了 Atari 套件中的训练速度。

关键词

引用

@article{arxiv.2501.00989,
  title  = {Bootstrapped Reward Shaping},
  author = {Jacob Adamczyk and Volodymyr Makarenko and Stas Tiomkin and Rahul V. Kulkarni},
  journal= {arXiv preprint arXiv:2501.00989},
  year   = {2025}
}

备注

Accepted at AAAI-2025, Main Track