从示范中学习模块化机器人 locomotion
机器人学
2022-11-01 v1 机器学习
摘要
模块化机器人可通过重新配置由一小组成分创建出多种设计。但仅构建机器人的硬件是不够的——每个机器人都需要一个控制器。人们可以为某些设计单独创建控制器,但为额外设计开发策略可能很耗时。本工作提出了一种方法,利用来自一组设计的示范来加速额外设计的策略学习。我们借助一个学习框架,其中图神经网络由模块化组件构成,每个组件对应于一种模块类型(例如腿、轮或身体),这些组件可重新组合以同时从多种设计学习。本文中我们开发了一种强化与模仿学习相结合的算法。我们的方法新颖之处在于,策略在一个目标函数内被优化以同时最大化某一设计的奖励,并模仿来自不同设计的示范。我们表明,当模块化策略以该组合目标优化时,来自一组设计的示范会影响策略在另一设计上的行为,减少了所需的训练迭代次数。
引用
@article{arxiv.2210.17491,
title = {Learning Modular Robot Locomotion from Demonstrations},
author = {Julian Whitman and Howie Choset},
journal= {arXiv preprint arXiv:2210.17491},
year = {2022}
}