中文

选择-扩展:运动规划与多样性搜索算法的统一框架

人工智能 2021-04-13 v1 机器学习 神经与进化计算

摘要

强化学习智能体需要奖励信号来学习成功的策略。当该信号稀疏或相应梯度具有欺骗性时,此类智能体需要一种专用机制来高效探索其搜索空间而不依赖奖励。在此背景下,寻找行为的高度多样性或使用运动规划(MP)算法是两种选择。本文基于这两种选择的共同根源,研究两种多样性搜索算法——新颖性搜索(Novelty Search)和目标探索过程(Goal Exploration Process)算法的性质。这些算法在结果空间或行为空间中寻找多样性,该空间通常为给定任务手工设计以表示关键要素。与 MP 算法的关系揭示出,策略参数空间与结果空间之间映射的光滑性(或缺乏光滑性)在搜索效率中起着关键作用。特别地,我们通过实验表明,若映射足够光滑,即参数空间中两个相近策略导致相似结果,则多样性算法倾向于继承 MP 算法的探索特性。相反,若非如此,多样性算法会丧失这些特性,其性能强烈依赖于特定启发式方法,尤其是丢弃部分已探索策略的过滤机制。

关键词

引用

@article{arxiv.2104.04768,
  title  = {Selection-Expansion: A Unifying Framework for Motion-Planning and Diversity Search Algorithms},
  author = {Alexandre Chenu and Nicolas Perrin-Gilbert and Stéphane Doncieux and Olivier Sigaud},
  journal= {arXiv preprint arXiv:2104.04768},
  year   = {2021}
}