中文

从偏差-方差视角解释离策略Actor-Critic

机器学习 2021-10-07 v1 人工智能

摘要

离策略Actor-Critic算法已展现出卓越的实验性能,但仍需更好的解释。为此,我们证明其在转移分布上的策略评估误差可分解为:Bellman误差、策略失配带来的偏差,以及采样带来的方差项。通过比较偏差与方差的大小,我们解释了强调近期经验采样和1/age加权采样取得成功的原因。这两种采样策略产生的偏差和方差更小,因此优于均匀采样。

关键词

引用

@article{arxiv.2110.02421,
  title  = {Explaining Off-Policy Actor-Critic From A Bias-Variance Perspective},
  author = {Ting-Han Fan and Peter J. Ramadge},
  journal= {arXiv preprint arXiv:2110.02421},
  year   = {2021}
}