熵正则化演员-评论家分析的细化
机器学习
2026-05-26 v1
摘要
本文研究了在有限折扣环境中,熵正则化演员-评论家方法中评论家作用的影响。我们证明,当评论家精确时,使用后者作为基线是一种强意义上的方差缩减方法。在这种情况下,基于随机梯度的演员-评论家方法能够实现确定性策略梯度的样本复杂度,达到最优正则化价值所需的样本数为。在实际中,评论家与演员一起学习:演员更新的方差随之受到评论家方差和偏差的影响。具体而言,当评论家具有足够小的误差时,方差缩减和快速收敛得以保持。这表明应先学习评论家,在每次演员更新后保持其更新,凸显了准确评论家估计在演员-评论家方法中的关键作用。
引用
@article{arxiv.2605.24357,
title = {Refined Analysis of Entropy-Regularized Actor-Critic},
author = {Safwan Labbi and Paul Mangold and Daniil Tiapkin and Eric Moulines},
journal= {arXiv preprint arXiv:2605.24357},
year = {2026}
}