中文

通过新奇寻求智能体群体改进深度强化学习中的进化策略探索

人工智能 2018-10-31 v3

摘要

进化策略(ES)是一类黑盒优化算法,在具有挑战性的深度强化学习(RL)问题上训练深度神经网络的性能大致可与 Q-learning 和策略梯度方法媲美,但因并行性更好而快得多(例如数小时对比数天)。然而,许多 RL 问题需要定向探索,因为其奖励函数稀疏或具欺骗性(即含局部最优),而如何以 ES 鼓励此类探索尚属未知。本文表明,为在小规模演化神经网络中通过探索智能体群体促进定向探索而发明的算法,特别是新奇搜索(NS)与质量多样性(QD)算法,可与 ES 混合以在稀疏或欺骗性深度 RL 任务上提升其性能,同时保持可扩展性。我们的实验证实,由此得到的新算法 NS-ES 与两种 QD 算法 NSR-ES 和 NSRA-ES,能避免 ES 遇到的局部最优,在 Atari 和模拟机器人学习绕过欺骗性陷阱行走的任务上取得更高性能。本文因而引入一类快速、可扩展且能进行定向探索的强化学习算法。它也将这类新探索算法加入 RL 工具箱,并提出了一种有趣的可能性:具有多条同时探索路径的类似算法或许也能与 ES 之外的现有 RL 算法良好结合。

关键词

引用

@article{arxiv.1712.06560,
  title  = {Improving Exploration in Evolution Strategies for Deep Reinforcement Learning via a Population of Novelty-Seeking Agents},
  author = {Edoardo Conti and Vashisht Madhavan and Felipe Petroski Such and Joel Lehman and Kenneth O. Stanley and Jeff Clune},
  journal= {arXiv preprint arXiv:1712.06560},
  year   = {2018}
}