祖先强化学习:统一零阶优化与遗传算法用于强化学习
机器学习
2024-09-04 v2
摘要
强化学习(RL)提供了一个通过与未知环境交互来发现最优动作策略的基本框架。近期进展表明,通过以多种方式利用智能体种群,RL 的性能和适用性可以显著提升。零阶优化(ZOO)利用智能体种群来估计目标函数的梯度,即使在不可微场景下也能实现稳健的策略优化。另一方面,遗传算法(GA)通过智能体种群中策略的变异生成来提升策略空间的探索能力,并通过选择进行精炼。一个自然的问题是,能否将两者优势结合。在这项工作中,我们提出了祖先强化学习(ARL),它协同结合了 ZOO 的稳健梯度估计与 GA 的探索能力。ARL 的核心思想是,种群中的每个智能体通过利用其祖先的历史(即过去的祖先种群)来推断梯度,同时保持当前种群中策略的多样性(如同 GA)。我们还从理论上揭示,ARL 中的种群搜索隐式地诱导了目标函数的 KL 正则化,从而增强了探索。我们的结果扩展了种群算法在 RL 中的适用性。
引用
@article{arxiv.2408.09493,
title = {Ancestral Reinforcement Learning: Unifying Zeroth-Order Optimization and Genetic Algorithms for Reinforcement Learning},
author = {So Nakashima and Tetsuya J. Kobayashi},
journal= {arXiv preprint arXiv:2408.09493},
year = {2024}
}
备注
16pages, 3 figures