中文

修正同策策略梯度方法中的折扣因子失配

机器学习 2023-06-26 v1 人工智能

摘要

策略梯度定理以三个因子的形式给出了策略梯度的便利表达:动作价值、动作似然的梯度,以及一个涉及折扣的称为\emph{折扣平稳分布}的状态分布。但基于策略梯度定理的常用同策(on-policy)方法忽略了状态分布中的折扣因子,这在技术上是不正确的,甚至可能在一些环境中导致退化的学习行为。一种现有解通过在梯度估计中使用 γt\gamma^t 作为因子来修正该偏差。然而,该解未被广泛采用,且在后期状态与早期状态相似的任务中表现不佳。我们引入了一种新颖的分布修正来考量折扣平稳分布,其可嵌入许多现有梯度估计器中。我们的修正以更低方差规避了与 γt\gamma^t 修正相关的性能退化。重要的是,与未修正的估计器相比,我们的算法提供了改进的状态强调,以在某些环境中避开次优策略,并在多个 OpenAI gym 与 DeepMind suite 基准上持续达到或超过原始性能。

关键词

引用

@article{arxiv.2306.13284,
  title  = {Correcting discount-factor mismatch in on-policy policy gradient methods},
  author = {Fengdi Che and Gautham Vasan and A. Rupam Mahmood},
  journal= {arXiv preprint arXiv:2306.13284},
  year   = {2023}
}