中文

PNS:面向困难探索环境中强化学习的种群引导新颖性搜索

机器学习 2021-10-12 v4 人工智能

摘要

强化学习 (RL) 已取得显著成就,但仍受限于探索策略不足、奖励信号稀疏以及奖励函数具有欺骗性等问题。为缓解这些问题,本文提出一种种群引导新颖性搜索 (PNS) 并行学习方法。在 PNS 中,种群被划分为多个子种群,每个子种群包含一个主导智能体 (chief agent) 和若干探索智能体。主导智能体评估探索智能体学到的策略,并将最优策略共享给所有子种群。探索智能体在最优策略引导下协作学习自身策略,同时将其策略上传至主导智能体。为平衡探索与利用,每个主导智能体采用新颖性搜索 (NS) 以鼓励具有高新颖性的策略,同时最大化单回合性能。我们将 PNS 应用于双延迟深度确定性 (TD3) 策略梯度算法。实验部分证明了 PNS 在连续控制领域促进探索和提升性能的有效性。值得注意的是,在稀疏或延迟奖励信号的环境中,PNS-TD3 取得的奖励远超 SOTA 方法。我们还展示了 PNS 使机器人智能体能够在仿真和真实世界设置中直接从像素学习用于稀疏奖励操作的策略。

关键词

引用

@article{arxiv.1811.10264,
  title  = {PNS: Population-Guided Novelty Search for Reinforcement Learning in Hard Exploration Environments},
  author = {Qihao Liu and Yujia Wang and Xiaofeng Liu},
  journal= {arXiv preprint arXiv:1811.10264},
  year   = {2021}
}

备注

Accepted to IROS 2021