拟牛顿兼容演员-评论机用于确定性策略
机器学习
2025-11-13 v1 系统与控制
系统与控制
最优化与控制
摘要
本文提出了一种基于确定性策略的二阶演员-评论框架,扩展了经典确定性策略梯度方法,以利用性能函数的曲率信息。基于评论家的兼容函数逼近概念,我们引入了二次评论家,同时保持真实策略梯度并近似性能 Hessian。随后发展出一种高效估计二次评论家参数的最小二乘时序差学习方案。该构建使演员能够利用评论家学习到的信息执行拟牛顿更新,从而实现比一阶方法更快的收敛。该方法具有普适性,可适用于任何可微策略类。数值示例表明,该方法在收敛速度和性能方面优于标准确定性演员-评论基线方法。
引用
@article{arxiv.2511.09509,
title = {Quasi-Newton Compatible Actor-Critic for Deterministic Policies},
author = {Arash Bahari Kordabad and Dean Brandner and Sebastien Gros and Sergio Lucia and Sadegh Soudjani},
journal= {arXiv preprint arXiv:2511.09509},
year = {2025}
}
备注
8 pages, 9 figs