面向机器人基于行为库在线适应的自适应先验选择
机器人学
2020-03-05 v3 人工智能
机器学习
神经与进化计算
摘要
基于行为库的学习是一种数据高效的适应方法,其基于两步过程:(1)在仿真中学习大量多样化的策略集,(2)规划或学习算法根据当前情况(例如受损机器人、新物体等)选择最合适的策略。在本文中,我们放宽了先前工作假设单一行为库足以适应的前提。相反,我们针对许多不同情况(例如缺失一条腿、在不同地面上等)生成行为库,并让我们的算法选择最有用的先验。我们的主要贡献是一种名为 APROL(Adaptive Prior selection for Repertoire-based Online Learning,基于行为库在线学习的自适应先验选择)的算法,用于在机器人对当前情况毫无信息时,通过融合这些先验来规划下一步动作。我们在两项仿真任务上评估了 APROL:(1)用机械臂推动未知形状和尺寸的物体,(2)受损六足机器人的目标到达任务。我们与“Reset-free Trial and Error”(RTE,无重置试错)及各种基于单一行为库的基线方法进行比较。结果表明,APROL 比基线方法以更少的交互时间解决了这两项任务。此外,我们在一台真实的受损六足机器人上演示了 APROL,其通过快速学习选取补偿性策略,在避开路径中障碍物的同时到达目标。
引用
@article{arxiv.1907.07029,
title = {Adaptive Prior Selection for Repertoire-based Online Adaptation in Robotics},
author = {Rituraj Kaushik and Pierre Desreumaux and Jean-Baptiste Mouret},
journal= {arXiv preprint arXiv:1907.07029},
year = {2020}
}
备注
Frontiers in Robotics and AI. Vol. 6, p. 151, 2020. Video : http://tiny.cc/aprol_video