中文

非正则化策略镜像下降中策略的收敛性研究

最优化与控制 2024-06-04 v3 机器学习

摘要

在这篇短文中,我们对近期著名的策略镜像下降(PMD)方法中的策略进行了收敛性分析。我们主要考虑遵循[11]的非正则化设定,并采用广义Bregman散度。不同之处在于,我们直接给出了广义Bregman散度下策略的收敛速率。我们的结果受到先前工作中值函数收敛性的启发,是对策略镜像下降方法的扩展研究。尽管部分结果已在先前工作中出现,但我们进一步发现,大量Bregman散度(例如经典的欧几里得距离)都能使策略在有限步内收敛到最优策略。

关键词

引用

@article{arxiv.2205.08176,
  title  = {On the Convergence of Policy in Unregularized Policy Mirror Descent},
  author = {Dachao Lin and Zhihua Zhang},
  journal= {arXiv preprint arXiv:2205.08176},
  year   = {2024}
}

备注

This paper has merged with another article: arXiv:2311.01104