从偏差-方差视角解释离策略Actor-Critic
机器学习
2021-10-07 v1 人工智能
摘要
离策略Actor-Critic算法已展现出卓越的实验性能,但仍需更好的解释。为此,我们证明其在转移分布上的策略评估误差可分解为:Bellman误差、策略失配带来的偏差,以及采样带来的方差项。通过比较偏差与方差的大小,我们解释了强调近期经验采样和1/age加权采样取得成功的原因。这两种采样策略产生的偏差和方差更小,因此优于均匀采样。
引用
@article{arxiv.2110.02421,
title = {Explaining Off-Policy Actor-Critic From A Bias-Variance Perspective},
author = {Ting-Han Fan and Peter J. Ramadge},
journal= {arXiv preprint arXiv:2110.02421},
year = {2021}
}