考察强化学习中的平均奖赏与折扣奖赏最优性准则
机器学习
2022-09-05 v2 人工智能
机器人学
系统与控制
系统与控制
摘要
在强化学习(RL)中,目标是获得最优策略,而最优性准则至关重要。两个主要的最优性准则是平均奖赏和折扣奖赏。尽管后者更流行,但将其应用于没有内在折扣概念的环境时存在问题。这促使我们重新审视:a)动态规划中最优性准则的演进;b)人为折扣因子的合理性及其复杂性;c)直接最大化无折扣的平均奖赏准则的益处。我们的贡献包括对平均奖赏与折扣奖赏之间关系的透彻考察,以及对其在RL中优缺点的讨论。我们强调,平均奖赏RL方法具备将一类无折扣最优性准则(Veinott, 1969)应用于RL的要素与机制。
引用
@article{arxiv.2107.01348,
title = {Examining average and discounted reward optimality criteria in reinforcement learning},
author = {Vektor Dewanto and Marcus Gallagher},
journal= {arXiv preprint arXiv:2107.01348},
year = {2022}
}
备注
23 pages, restructuring, adding more details