策略镜像梯度的函数加速
机器学习
2025-03-26 v2 人工智能
机器学习
摘要
我们将函数加速应用于策略镜像梯度(Policy Mirror Descent, PMD)的一系列算法,这些算法涵盖了强化学习(Reinforcement Learning, RL)中各种新颖且根本的方法。通过利用对偶性,我们提出了一种基于动量的PMD更新方法。凭借函数化路径,我们的方法独立于策略参数化,适用于大规模优化,覆盖了在策略参数层面应用动量的先前方法。我们对该方法的若干性质进行了理论分析,并通过数值消融研究补充说明,在价值多边形上进行策略优化动力学,针对该空间中不同算法设计选择进行了分析。我们进一步对问题设置的若干特征进行数值表征,最后研究了近似对学习机制的影响。
引用
@article{arxiv.2407.16602,
title = {Functional Acceleration for Policy Mirror Descent},
author = {Veronica Chelu and Doina Precup},
journal= {arXiv preprint arXiv:2407.16602},
year = {2025}
}