中文

UGAE:一种非指数折扣的新方法

机器学习 2023-02-14 v1 人工智能

摘要

强化学习中的折扣机制决定了未来奖励与当前奖励的相对重要性。虽然指数折扣在实践中被广泛使用,但符合人类行为的非指数折扣方法常有助于构建类人智能体。然而,非指数折扣方法无法直接应用于现代 on-policy actor-critic 算法。为解决该问题,我们提出通用广义优势估计(UGAE),其允许以任意折扣计算 GAE 优势值。此外,我们引入 Beta 加权折扣,作为指数与双曲折扣之间的连续插值,以增加选择折扣方法的灵活性。为展示 UGAE 的效用,我们分析了各种折扣方法的特性。我们还通过实验表明,经 UGAE 训练的非指数折扣智能体优于使用蒙特卡洛优势估计训练的变体。通过对各种折扣方法的分析与实验,我们证明了在标准 RL 基准上,采用 Beta 加权折扣的 UGAE 优于蒙特卡洛基线。UGAE 简单且易于集成到任何基于优势的算法中,作为标准递归 GAE 的替代。

关键词

引用

@article{arxiv.2302.05740,
  title  = {UGAE: A Novel Approach to Non-exponential Discounting},
  author = {Ariel Kwiatkowski and Vicky Kalogeiton and Julien Pettré and Marie-Paule Cani},
  journal= {arXiv preprint arXiv:2302.05740},
  year   = {2023}
}