双近似策略优化
机器学习
2024-10-03 v1
摘要
我们提出了双近似策略优化 (DAPO) 框架,将通用函数近似纳入策略镜像梯度方法中。与流行的使用 范数衡量函数近似误差的方法不同,DAPO 使用由镜像图产生的对偶 Bregman 发散用于策略投影。这种对偶框架具有理论和实际意义:不仅实现了基于通用函数近似的快速线性收敛,还包括几个众所周知的实用方法作为特例,立即提供了强大的收敛保证。
引用
@article{arxiv.2410.01249,
title = {Dual Approximation Policy Optimization},
author = {Zhihan Xiong and Maryam Fazel and Lin Xiao},
journal= {arXiv preprint arXiv:2410.01249},
year = {2024}
}
备注
30 pages, 2 figures