利用优势函数符号在连续域中学习确定性策略
机器学习
2021-02-24 v2 机器学习
摘要
在连续域中学习确定性策略的背景下,我们重新审视了一种方法,该方法最初在连续演员-评论家学习自动机(CACLA)中提出,后来在神经拟合演员-评论家(NFAC)中得到扩展。此方法基于一种不同于确定性策略梯度(DPG)的策略更新。先前的工作已通过实验观察到其优异的性能,但缺乏理论上的论证。为了填补这一空白,我们通过将该更新与另一种更新相关联,并明确后者的目标函数,提供了一个理论解释来阐明这种非正统策略更新的动机。我们进一步深入讨论了这些更新的性质,以更深入地理解整体方法。此外,我们对其进行了扩展,并提出了一种新的信赖域算法,即惩罚性NFAC(PeNFAC)。最后,我们在几个经典控制问题中通过实验证明,该算法在学习确定性策略方面超越了当前最先进的算法。
引用
@article{arxiv.1906.04556,
title = {Exploiting the Sign of the Advantage Function to Learn Deterministic Policies in Continuous Domains},
author = {Matthieu Zimmer and Paul Weng},
journal= {arXiv preprint arXiv:1906.04556},
year = {2021}
}
备注
International Joint Conferences on Artificial Intelligence