中文

策略镜像梯度的函数加速

机器学习 2025-03-26 v2 人工智能 机器学习

摘要

我们将函数加速应用于策略镜像梯度(Policy Mirror Descent, PMD)的一系列算法,这些算法涵盖了强化学习(Reinforcement Learning, RL)中各种新颖且根本的方法。通过利用对偶性,我们提出了一种基于动量的PMD更新方法。凭借函数化路径,我们的方法独立于策略参数化,适用于大规模优化,覆盖了在策略参数层面应用动量的先前方法。我们对该方法的若干性质进行了理论分析,并通过数值消融研究补充说明,在价值多边形上进行策略优化动力学,针对该空间中不同算法设计选择进行了分析。我们进一步对问题设置的若干特征进行数值表征,最后研究了近似对学习机制的影响。

关键词

引用

@article{arxiv.2407.16602,
  title  = {Functional Acceleration for Policy Mirror Descent},
  author = {Veronica Chelu and Doina Precup},
  journal= {arXiv preprint arXiv:2407.16602},
  year   = {2025}
}