论强化学习中抽象与基于势函数的奖励塑造的样本效率
机器学习
2025-08-12 v2 人工智能
摘要
在解决强化学习(RL)样本效率低下的持续研究努力中,基于势函数的奖励塑造(PBRS)展现出了巨大的前景。然而,选择合适的势函数仍然是一个开放挑战。此外,由于计算限制,RL 技术通常被约束为使用有限时域,这在应用 PBRS 时引入了偏差。在本文中,我们首先建立了一些具有理论依据的直觉,解释为何将势函数选择为当前任务的最优值函数会带来性能优势。然后,我们分析了 PBRS 中由有限时域引起的偏差,产生了新的见解。最后,以抽象作为近似给定任务最优值函数的方式,我们在四个环境(包括一个目标导向导航任务和三个 Arcade Learning Environment (ALE) 游戏)上评估了 PBRS 对样本效率和性能的影响。值得注意的是,实验结果表明,使用一个简单的全连接网络即可达到与基于 CNN 的解决方案相同的性能水平。
引用
@article{arxiv.2404.07826,
title = {On the Sample Efficiency of Abstractions and Potential-Based Reward Shaping in Reinforcement Learning},
author = {Giuseppe Canonaco and Leo Ardon and Alberto Pozanco and Daniel Borrajo},
journal= {arXiv preprint arXiv:2404.07826},
year = {2025}
}