通过模拟先验的元学习嵌入实现机器人快速在线适应
机器人学
2021-01-08 v2 人工智能
机器学习
摘要
元学习算法可以通过为动力学模型找到一组初始参数来加速基于模型的强化学习(MBRL)算法,使得模型仅需少量数据点即可训练以匹配系统的实际动力学。然而,在现实世界中,机器人可能遇到从电机故障到身处岩石地形等各种情况,其动力学彼此之间可能存在显著差异。本文中,我们首先表明,当元训练情境(先验情境)具有如此多样的动力学时,使用单一组元训练参数作为起点仍然需要来自真实系统的大量观测才能学习到有用的动力学模型。其次,我们提出一种称为 FAMLE 的算法,通过元训练多个用于训练模型的初始起点(即初始参数)来缓解这一局限,并允许机器人选择最合适的起点,仅通过少量梯度步即可将模型适应到当前情境。我们将 FAMLE 与 MBRL、带有 MAML 元训练模型的 MBRL,以及无模型策略搜索算法 PPO 在各种模拟和真实机器人任务上进行比较,结果表明 FAMLE 使机器人适应新型损伤所需的时间步数显著少于基线方法。
引用
@article{arxiv.2003.04663,
title = {Fast Online Adaptation in Robotics through Meta-Learning Embeddings of Simulated Priors},
author = {Rituraj Kaushik and Timothée Anne and Jean-Baptiste Mouret},
journal= {arXiv preprint arXiv:2003.04663},
year = {2021}
}
备注
2020 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) | Video: http://tiny.cc/famle_video