中文

面向连续动作空间的Actor加速策略二次平均

机器学习 2026-03-12 v1

摘要

策略二次平均(Policy Dual Averaging, PDA)提供了一种更自然地容纳价值函数近似的策略镜像梯度(Policy Mirror Descent, PMD)框架,使其能够在保持强收敛保证的同时使用近似优势(或Q值)函数。然而,在连续状态和动作空间中应用PDA仍然计算上具有挑战性,因为动作选择涉及在每个决策步骤中求解优化子问题。本文提出了\textit{actor加速PDA},使用学习的策略网络近似求解优化子问题,实现更快的运行时间同时保持收敛保证。我们提供了理论分析,量化了actor近似误差如何在适当假设下影响PDA的收敛。随后,我们在机器人、控制和运营研究问题的多个基准上评估其性能。Actor加速PDA在众多基于PPO等流行的单策略基线之上实现卓越的性能。总体而言,我们的结果弥合了PDA在具备函数近似的连续动作问题中的理论优势与实际部署之间的差距。

关键词

引用

@article{arxiv.2603.10199,
  title  = {Actor-Accelerated Policy Dual Averaging for Reinforcement Learning in Continuous Action Spaces},
  author = {Ji Gao and Caleb Ju and Guanghui Lan and Zhaohui Tong},
  journal= {arXiv preprint arXiv:2603.10199},
  year   = {2026}
}