超越兼容函数逼近的策略镜像下降收敛性
机器学习
2025-07-08 v3 最优化与控制
机器学习
摘要
现代策略优化方法大致遵循策略镜像下降(PMD)算法模板,目前已有众多理论收敛结果。然而,这些结果大多针对表格环境,或者仅能在所优化的策略类满足强闭包条件时有效应用,而在使用参数化策略类处理大规模环境时,这通常不成立。在本工作中,我们为一般策略类开发了PMD的理论框架,用一个严格较弱的变分梯度优势假设取代了闭包条件,并获得了收敛到类内最优策略的速率上界。我们的主要结果利用了一种关于由当前策略的占用测度诱导的局部范数的光滑性新概念,并将PMD刻画为非欧几里得空间中光滑非凸优化的一个特例。
引用
@article{arxiv.2502.11033,
title = {Convergence of Policy Mirror Descent Beyond Compatible Function Approximation},
author = {Uri Sherman and Tomer Koren and Yishay Mansour},
journal= {arXiv preprint arXiv:2502.11033},
year = {2025}
}