中文

进化策略与强化学习方法在自主智能体控制中的质性差异

人工智能 2022-05-17 v1 机器学习 神经与进化计算

摘要

本文通过分析两种流行的先进算法——OpenAI-ES 进化策略与近端策略优化(PPO)强化学习算法(两族中最相似的方法)——来研究进化策略与强化学习算法之间的质性差异。我们分析了这些方法在以下方面的不同:(i)总体效能,(ii)应对稀疏奖励的能力,(iii)发现最小解的倾向/能力,(iv)对奖励塑形的依赖,以及(v)应对环境条件变化的能力。对两种方法在基准问题上训练出的智能体所展现的性能与行为策略的分析,使我们得以揭示先前研究未辨识出的质性差异,找出两方法的相对弱点,并提出缓解部分弱点的途径。我们表明,奖励函数的特征具有强烈影响,且这种影响对 OpenAI-ES 与 PPO 乃至其他替代强化学习算法均存在质性上的不同,从而证明了针对所用算法优化奖励函数特征的重要性。

关键词

引用

@article{arxiv.2205.07592,
  title  = {Qualitative Differences Between Evolutionary Strategies and Reinforcement Learning Methods for Control of Autonomous Agents},
  author = {Nicola Milano and Stefano Nolfi},
  journal= {arXiv preprint arXiv:2205.07592},
  year   = {2022}
}