自举奖励塑形
机器学习
2025-07-28 v2 人工智能
摘要
在强化学习中,尤其是在稀疏奖励领域,需要许多环境步骤才能观察到奖励信息。为了提高此类观察的频率,已提出“基于势函数的奖励塑形”(PBRS)作为一种提供更密集奖励信号同时保持最优策略不变的方法。然而,所需的“势函数”必须利用任务相关知识进行仔细设计,以免损害训练性能。在本工作中,我们提出了一种“自举”的奖励塑形方法,称为 BSRS,其中智能体对状态值函数的当前估计充当 PBRS 的势函数。我们提供了表格设置下的收敛证明,深入分析了深度强化学习的训练动态,并表明所提方法提高了 Atari 套件中的训练速度。
引用
@article{arxiv.2501.00989,
title = {Bootstrapped Reward Shaping},
author = {Jacob Adamczyk and Volodymyr Makarenko and Stas Tiomkin and Rahul V. Kulkarni},
journal= {arXiv preprint arXiv:2501.00989},
year = {2025}
}
备注
Accepted at AAAI-2025, Main Track