中文

直接优势估计

机器学习 2023-02-07 v3

摘要

强化学习中的主流方法是基于期望回报对动作进行信用分配。然而,我们表明回报可能以某种依赖于策略的方式变化,从而导致价值估计的方差过大并减慢学习速度。相反,我们表明优势函数可被解释为因果效应,并与因果表示具有相似性质。基于这一洞见,我们提出了直接优势估计(DAE),一种新颖的方法,该方法可以对优势函数进行建模并直接从同策略数据中估计它,同时最小化回报的方差而无需(动作)价值函数。我们还通过将价值函数如何无缝集成到DAE中,将我们的方法与时序差分方法联系起来。所提出的方法易于实现,并且可以被现代演员-评论家方法轻松采用。我们在三个离散控制领域对DAE进行了实证评估,并表明当应用于策略优化时,它在大多数环境中优于广义优势估计(GAE)——一个强大的优势估计基线。

关键词

引用

@article{arxiv.2109.06093,
  title  = {Direct Advantage Estimation},
  author = {Hsiao-Ru Pan and Nico Gürtler and Alexander Neitz and Bernhard Schölkopf},
  journal= {arXiv preprint arXiv:2109.06093},
  year   = {2023}
}

备注

Published at NeurIPS 2022