中文

面向 Actor-Critic 算法中高效策略更新的超越策略梯度定理方法

机器学习 2022-02-16 v1 人工智能 最优化与控制 机器学习

摘要

在强化学习中,给定状态下的最优动作取决于后续状态的策略决策。因此,学习目标随时间演化,策略优化过程必须能够高效地遗忘其先前所学。在本文中,我们发现策略梯度定理所规定的策略更新由于其相对于价值目标的结构对称性,在遗忘方面速度缓慢。为了提高遗忘速度,我们研究了一种新颖的策略更新:交叉熵损失相对于使 qq 最大化的动作的梯度,但发现此类更新可能导致价值下降。因此,我们引入了一种消除了该缺陷的修正策略更新,并证明了在经典假设下其以 O(t1)\mathcal{O}(t^{-1}) 收敛至全局最优的保证。此外,我们沿着六个分析维度评估了标准策略更新和我们的交叉熵策略更新。最后,我们通过实验验证了我们的理论发现。

关键词

引用

@article{arxiv.2202.07496,
  title  = {Beyond the Policy Gradient Theorem for Efficient Policy Updates in Actor-Critic Algorithms},
  author = {Romain Laroche and Remi Tachet},
  journal= {arXiv preprint arXiv:2202.07496},
  year   = {2022}
}

备注

9p+appendix, accepted to AISTATS 2022