中文

面向基于多样性的神经进化改进的策略流形搜索

机器学习 2020-12-17 v1 神经与进化计算

摘要

基于多样性的方法近来作为基于性能的策略搜索的替代范式而流行。该家族中一种流行的方法,质量-多样性(QD),维护一组在多样性度量空间中分离的高性能策略,该空间基于策略的 rollout 行为定义。当策略被参数化为神经网络(即神经进化)时,QD往往不能很好地随参数空间维度扩展。我们的假设是,在策略参数空间中存在一个低维流形,其包含高密度多样且可行的策略。我们提出一种通过神经进化进行基于多样性策略搜索的新方法,其利用策略参数的学习潜表示来捕获数据的局部结构。我们的方法依据QD框架迭代收集策略,以(i)构建多样策略集合,(ii)用它学习策略参数的潜表示,(iii)在所学潜空间中进行策略搜索。我们使用逆变换(即重构函数)的雅可比矩阵来引导潜空间中的搜索。这确保生成的样本在重构后仍位于原始空间的高密度区域。我们在模拟环境中的三个连续控制任务上评估我们的贡献,并与基于多样性的基线比较。研究结果表明,我们的方法产生了更高效且鲁棒的策略搜索过程。

关键词

引用

@article{arxiv.2012.08676,
  title  = {Policy Manifold Search for Improving Diversity-based Neuroevolution},
  author = {Nemanja Rakicevic and Antoine Cully and Petar Kormushev},
  journal= {arXiv preprint arXiv:2012.08676},
  year   = {2020}
}

备注

Paper accepted as oral (8% acceptance rate) at Beyond Backpropagation: Novel Ideas for Training Neural Architectures Workshop at NeurIPS 2020