中文

通过无重置质量-多样性实现自主行走学习

机器学习 2022-07-12 v1 人工智能 神经与进化计算 机器人学

摘要

质量-多样性(QD)算法可以发现由多样且高性能的技能组成的大型复杂行为库。然而,行为库的生成主要局限于仿真环境,而非真实世界中的学习。这是因为现有的 QD 算法需要大量的评估以及周期性的重置,这需要人工监督和干预。本文提出无重置质量-多样性优化(RF-QD),作为在开放式环境中实现机器人自主学习的一个步骤。我们以动力学感知质量-多样性(DA-QD)为基础,引入了一种行为选择策略,该策略利用想象行为库的多样性和环境信息,智能地选择能够充当自动重置的行为。我们通过一个在带有障碍物的指定训练区域内学习行走的任务来演示这一点。我们的实验表明,尽管存在严格的安全约束,我们仍能以高样本效率自主地学习完整的腿式运动控制器行为库,而无需人工重置。最后,通过对不同目标函数的消融研究,我们表明,对于 RF-QD 的行为选择策略而言,拥有针对特定目标优化的解决方案之外的多种类型解决方案是重要的。视频和代码见 https://sites.google.com/view/rf-qd。

关键词

引用

@article{arxiv.2204.03655,
  title  = {Learning to Walk Autonomously via Reset-Free Quality-Diversity},
  author = {Bryan Lim and Alexander Reichenbach and Antoine Cully},
  journal= {arXiv preprint arXiv:2204.03655},
  year   = {2022}
}