策略优化的贪婪化算子:前向与反向KL散度的研究
机器学习
2022-04-20 v2
摘要
近似策略迭代(API)算法在(近似)策略评估与(近似)贪婪化之间交替。针对近似策略评估已探索许多不同方法,但对近似贪婪化以及何种选择能保证策略改进则理解较少。本工作中,我们研究在降低参数化策略与动作值上的玻尔兹曼分布之间的KL散度时的近似贪婪化。特别地,我们研究前向与反向KL散度在不同程度熵正则化下的差异。我们证明反向KL具有更强的策略改进保证,但降低前向KL可能导致更差的策略。然而我们也证明,在前向KL足够大的降幅下,可在附加假设下诱导改进。通过实验,我们在简单连续动作环境上展示前向KL可诱导更多探索,但代价是策略更次优。在离散动作设定或一组基准问题上未观察到显著差异。自始至终,我们强调许多策略梯度方法可视为API的实例,其策略更新采用前向或反向KL,并讨论理解与改进策略优化算法的后续步骤。
引用
@article{arxiv.2107.08285,
title = {Greedification Operators for Policy Optimization: Investigating Forward and Reverse KL Divergences},
author = {Alan Chan and Hugo Silva and Sungsu Lim and Tadashi Kozuno and A. Rupam Mahmood and Martha White},
journal= {arXiv preprint arXiv:2107.08285},
year = {2022}
}
备注
Updated the paper with more theory in Section 5 and moved some experiments to the Appendix