中文

基于元策略优化的快速适应学习

机器人学 2020-02-18 v2 机器学习

摘要

在新场景中行走是足式机器人走向实际应用的关键里程碑。在这项工作中,我们提出元策略优化(Meta Strategy Optimization, MSO),一种用于训练具有潜变量输入的策略的元学习算法,该策略可在目标环境中通过少量试验快速适应新场景。MSO背后的关键思想是将相同的适应过程——策略优化(Strategy Optimization, SO)——同时暴露于训练阶段和测试阶段。这使得MSO能够有效学习运动技能以及适合快速适应的潜空间。我们在真实的四足机器人上评估了我们的方法,并展示了在各种场景下的成功适应,包括仿真到实物的迁移、带弱化电机行走或爬坡。此外,我们在仿真环境中定量分析了所训练策略的泛化能力。真实与仿真实验均表明,我们的方法在适应新任务方面优于先前的方法。

关键词

引用

@article{arxiv.1909.12995,
  title  = {Learning Fast Adaptation with Meta Strategy Optimization},
  author = {Wenhao Yu and Jie Tan and Yunfei Bai and Erwin Coumans and Sehoon Ha},
  journal= {arXiv preprint arXiv:1909.12995},
  year   = {2020}
}