选择-扩展:运动规划与多样性搜索算法的统一框架
人工智能
2021-04-13 v1 机器学习
神经与进化计算
摘要
强化学习智能体需要奖励信号来学习成功的策略。当该信号稀疏或相应梯度具有欺骗性时,此类智能体需要一种专用机制来高效探索其搜索空间而不依赖奖励。在此背景下,寻找行为的高度多样性或使用运动规划(MP)算法是两种选择。本文基于这两种选择的共同根源,研究两种多样性搜索算法——新颖性搜索(Novelty Search)和目标探索过程(Goal Exploration Process)算法的性质。这些算法在结果空间或行为空间中寻找多样性,该空间通常为给定任务手工设计以表示关键要素。与 MP 算法的关系揭示出,策略参数空间与结果空间之间映射的光滑性(或缺乏光滑性)在搜索效率中起着关键作用。特别地,我们通过实验表明,若映射足够光滑,即参数空间中两个相近策略导致相似结果,则多样性算法倾向于继承 MP 算法的探索特性。相反,若非如此,多样性算法会丧失这些特性,其性能强烈依赖于特定启发式方法,尤其是丢弃部分已探索策略的过滤机制。
引用
@article{arxiv.2104.04768,
title = {Selection-Expansion: A Unifying Framework for Motion-Planning and Diversity Search Algorithms},
author = {Alexandre Chenu and Nicolas Perrin-Gilbert and Stéphane Doncieux and Olivier Sigaud},
journal= {arXiv preprint arXiv:2104.04768},
year = {2021}
}