中文

考察强化学习中的平均奖赏与折扣奖赏最优性准则

机器学习 2022-09-05 v2 人工智能 机器人学 系统与控制 系统与控制

摘要

在强化学习(RL)中,目标是获得最优策略,而最优性准则至关重要。两个主要的最优性准则是平均奖赏和折扣奖赏。尽管后者更流行,但将其应用于没有内在折扣概念的环境时存在问题。这促使我们重新审视:a)动态规划中最优性准则的演进;b)人为折扣因子的合理性及其复杂性;c)直接最大化无折扣的平均奖赏准则的益处。我们的贡献包括对平均奖赏与折扣奖赏之间关系的透彻考察,以及对其在RL中优缺点的讨论。我们强调,平均奖赏RL方法具备将一类无折扣最优性准则(Veinott, 1969)应用于RL的要素与机制。

关键词

引用

@article{arxiv.2107.01348,
  title  = {Examining average and discounted reward optimality criteria in reinforcement learning},
  author = {Vektor Dewanto and Marcus Gallagher},
  journal= {arXiv preprint arXiv:2107.01348},
  year   = {2022}
}

备注

23 pages, restructuring, adding more details