基线在策略梯度优化中的作用
机器学习
2023-01-18 v1 人工智能
摘要
我们研究了基线在 on-policy 随机策略梯度优化中的影响,并弥合了策略优化方法的理论与实践之间的差距。我们的第一个贡献是证明 \emph{状态值} 基线允许 on-policy 随机 \emph{自然} 策略梯度(NPG)以 的速率收敛到全局最优策略,这是先前未知的。该分析依赖于两个新发现:NPG 更新的期望进展满足非均匀 \L{}ojasiewicz(N\L{})不等式的随机版本,并且以概率 1 状态值基线防止最优动作的概率消失,从而确保充分探索。重要的是,这些结果提供了对随机策略梯度中基线作用的新理解:通过表明无论有无基线自然策略梯度估计的方差都保持无界,我们发现方差缩减 \emph{不能} 解释其在此设置中的效用。相反,分析揭示价值基线的主要效果是 \textbf{降低更新的激进性} 而非其方差。即,我们证明有限方差对于随机 NPG 的几乎必然收敛 \emph{不是必要的},而控制更新激进性既必要又充分。额外的实验结果验证了这些理论发现。
引用
@article{arxiv.2301.06276,
title = {The Role of Baselines in Policy Gradient Optimization},
author = {Jincheng Mei and Wesley Chung and Valentin Thomas and Bo Dai and Csaba Szepesvari and Dale Schuurmans},
journal= {arXiv preprint arXiv:2301.06276},
year = {2023}
}
备注
55 pages; published at NeurIPS 2022