中文

双近似策略优化

机器学习 2024-10-03 v1

摘要

我们提出了双近似策略优化 (DAPO) 框架,将通用函数近似纳入策略镜像梯度方法中。与流行的使用 L2L_2 范数衡量函数近似误差的方法不同,DAPO 使用由镜像图产生的对偶 Bregman 发散用于策略投影。这种对偶框架具有理论和实际意义:不仅实现了基于通用函数近似的快速线性收敛,还包括几个众所周知的实用方法作为特例,立即提供了强大的收敛保证。

关键词

引用

@article{arxiv.2410.01249,
  title  = {Dual Approximation Policy Optimization},
  author = {Zhihan Xiong and Maryam Fazel and Lin Xiao},
  journal= {arXiv preprint arXiv:2410.01249},
  year   = {2024}
}

备注

30 pages, 2 figures