TD 正则化 Actor-Critic 方法
机器学习
2019-02-26 v3 机器学习
摘要
Actor-critic 方法能在困难的强化学习问题上取得令人惊叹的性能,但它们也易于不稳定。这部分归因于学习过程中 actor 与 critic 之间的相互作用,例如其中一方采取的不准确步骤可能对另一方产生不利影响并使学习失稳。为避免此类问题,我们提出通过对 actor 的学习目标施加对 critic 的时序差分(temporal difference, TD)误差的惩罚来进行正则化。这通过避免在 critic 高度不准确时 actor 更新中采取大步长而提升了稳定性。所得方法被称为 TD 正则化 actor-critic 方法,是一种简单即插即用的途径,用以改善 actor-critic 方法的稳定性与整体性能。在标准基准上的评估证实了这一点。
引用
@article{arxiv.1812.08288,
title = {TD-Regularized Actor-Critic Methods},
author = {Simone Parisi and Voot Tangkaratt and Jan Peters and Mohammad Emtiyaz Khan},
journal= {arXiv preprint arXiv:1812.08288},
year = {2019}
}