超越方差缩减:理解基线对策略优化的真正影响
机器学习
2021-02-22 v3 机器学习
摘要
bandit 与强化学习(RL)问题常被框定为优化问题,其目标是在仅能获取真实梯度随机估计的情况下最大化平均性能。传统上,随机优化理论预测学习动态由损失函数的曲率与梯度估计的噪声所支配。在本文中,我们证明对于 bandit 与 RL 问题情况并非如此。为使我们的分析能结合多步 MDP 进行解读,我们聚焦于源自随机优化原理的技术(如自然策略梯度与 EXP3),并表明优化理论中的某些标准假设在这些问题中被违背。我们给出理论结果表明,至少对于 bandit 问题,曲率与噪声不足以解释学习动态,且看似无害的选择(如基线)可决定算法是否收敛。这些理论发现与我们的实证评估相符,我们将评估扩展到了多状态 MDP。
引用
@article{arxiv.2008.13773,
title = {Beyond variance reduction: Understanding the true impact of baselines on policy optimization},
author = {Wesley Chung and Valentin Thomas and Marlos C. Machado and Nicolas Le Roux},
journal= {arXiv preprint arXiv:2008.13773},
year = {2021}
}