零阶 actor-critic:一种面向序列决策问题的进化框架
机器学习
2025-01-14 v4 人工智能
系统与控制
系统与控制
摘要
进化算法(EAs)通过将序列决策问题(SDPs)简化为静态优化问题并以零阶方式搜索最优策略参数,在求解 SDPs 方面已显示出前景。尽管这些方法具有高度通用性,但由于忽略底层时间结构,它们常面临高样本复杂度。相比之下,强化学习(RL)方法通常将 SDPs 建模为马尔可夫决策过程(MDP)。虽然比 EAs 样本效率更高,RL 方法局限于可微策略且易陷入局部最优。为解决这些问题,我们提出一种新颖的进化框架零阶 Actor-Critic(ZOAC)。我们提出在参数空间中使用逐步探索,并从理论上推导零阶策略梯度。我们进一步利用 actor-critic 架构来有效利用 SDPs 的马尔可夫性质并降低梯度估计的方差。在每次迭代中,ZOAC 采用采样器通过参数空间探索收集轨迹,并在一阶策略评估(PEV)与零阶策略改进(PIM)之间交替。为评估 ZOAC 的有效性,我们将其应用于一项具有挑战性的多车道驾驶任务,优化一个基于规则、不可微的驾驶策略参数,该策略由三个子模块组成:行为选择、路径规划和轨迹跟踪。我们还在三个 Gymnasium 任务上将其与基于梯度的 RL 方法比较,优化具有数千参数的神经网络策略。实验结果表明 ZOAC 在求解 SDPs 方面的强大能力。ZOAC 显著优于将问题视为静态优化的 EAs,并且即使没有一阶信息,在所有任务的总平均回报方面也匹配基于梯度的 RL 方法的性能。
引用
@article{arxiv.2201.12518,
title = {Zeroth-Order Actor-Critic: An Evolutionary Framework for Sequential Decision Problems},
author = {Yuheng Lei and Yao Lyu and Guojian Zhan and Tao Zhang and Jiangtao Li and Jianyu Chen and Shengbo Eben Li and Sifa Zheng},
journal= {arXiv preprint arXiv:2201.12518},
year = {2025}
}
备注
Accepted by IEEE Transactions on Evolutionary Computation, Copyright @IEEE