演化面向泛化性与稳定性的帕累托最优演员-评论家算法
机器学习
2023-04-26 v3
摘要
泛化性与稳定性是在真实世界中运行强化学习(RL)智能体的两个关键目标。设计优化这些目标的RL算法可能是一个昂贵且费力的过程。本文提出MetaPG,一种用于自动设计演员-评论家损失函数的演化方法。MetaPG显式优化泛化性与性能,并隐式优化这两项指标的稳定性。我们以Soft Actor-Critic(SAC)初始化损失函数种群,并使用编码单任务性能、对未见环境配置的零样本泛化性以及不同随机种子独立运行间稳定性的适应度指标进行多目标优化。在Real-World RL Benchmark Suite的一组连续控制任务上,我们发现仅使用单一环境进行演化时,所提方法演化的算法相较SAC在性能和泛化性上分别提升4%和20%,并将不稳定性最多降低67%。随后,我们扩展到Brax物理模拟器中更复杂的环境,并复现实际场景中的泛化性测试,例如不同摩擦系数。MetaPG演化的算法在同一元训练环境中可在不损失性能的前提下获得10%更好的泛化性,并在其他Brax环境的交叉域评估中取得与SAC相似的结果。演化结果可解释;通过分析最优算法的结构,我们识别出有助于优化特定目标的元素,例如评论家损失的正则化项。
引用
@article{arxiv.2204.04292,
title = {Evolving Pareto-Optimal Actor-Critic Algorithms for Generalizability and Stability},
author = {Juan Jose Garau-Luis and Yingjie Miao and John D. Co-Reyes and Aaron Parisi and Jie Tan and Esteban Real and Aleksandra Faust},
journal= {arXiv preprint arXiv:2204.04292},
year = {2023}
}