中文

熵正则化演员-评论家分析的细化

机器学习 2026-05-26 v1

摘要

本文研究了在有限折扣环境中,熵正则化演员-评论家方法中评论家作用的影响。我们证明,当评论家精确时,使用后者作为基线是一种强意义上的方差缩减方法。在这种情况下,基于随机梯度的演员-评论家方法能够实现确定性策略梯度的样本复杂度,达到ϵ\epsilon最优正则化价值所需的样本数为O~(log(1/ϵ))\tilde{O}(\log(1/\epsilon))。在实际中,评论家与演员一起学习:演员更新的方差随之受到评论家方差和偏差的影响。具体而言,当评论家具有足够小的误差时,方差缩减和快速收敛得以保持。这表明应先学习评论家,在每次演员更新后保持其更新,凸显了准确评论家估计在演员-评论家方法中的关键作用。

关键词

引用

@article{arxiv.2605.24357,
  title  = {Refined Analysis of Entropy-Regularized Actor-Critic},
  author = {Safwan Labbi and Paul Mangold and Daniil Tiapkin and Eric Moulines},
  journal= {arXiv preprint arXiv:2605.24357},
  year   = {2026}
}