直接优势估计
机器学习
2023-02-07 v3
摘要
强化学习中的主流方法是基于期望回报对动作进行信用分配。然而,我们表明回报可能以某种依赖于策略的方式变化,从而导致价值估计的方差过大并减慢学习速度。相反,我们表明优势函数可被解释为因果效应,并与因果表示具有相似性质。基于这一洞见,我们提出了直接优势估计(DAE),一种新颖的方法,该方法可以对优势函数进行建模并直接从同策略数据中估计它,同时最小化回报的方差而无需(动作)价值函数。我们还通过将价值函数如何无缝集成到DAE中,将我们的方法与时序差分方法联系起来。所提出的方法易于实现,并且可以被现代演员-评论家方法轻松采用。我们在三个离散控制领域对DAE进行了实证评估,并表明当应用于策略优化时,它在大多数环境中优于广义优势估计(GAE)——一个强大的优势估计基线。
引用
@article{arxiv.2109.06093,
title = {Direct Advantage Estimation},
author = {Hsiao-Ru Pan and Nico Gürtler and Alexander Neitz and Bernhard Schölkopf},
journal= {arXiv preprint arXiv:2109.06093},
year = {2023}
}
备注
Published at NeurIPS 2022