中文

面向多机器人迁移学习的硬件条件策略

机器人学 2019-01-15 v2 人工智能 机器学习

摘要

深度强化学习可用于学习灵巧的机器人策略,但将其迁移到具有截然不同硬件属性的新机器人上具有挑战性。由于现代最先进算法的高样本复杂度,为每个机器人硬件从头学习新策略的成本也高得令人望而却步。我们提出了一种称为硬件条件策略(Hardware Conditioned Policies)的新方法,其中我们训练一个以机器人硬件的向量表示为条件的通用策略。我们考虑了具有不同动力学、运动学结构、运动学长度和自由度的仿真机器人。首先,我们直接使用运动学结构作为硬件编码,并展示了对训练期间完全未见过的新机器人的极佳零样本迁移。对于零样本成功率较低的机器人,我们还证明微调策略网络比从头训练模型具有显著更高的样本效率。在需要了解智能体动力学才能成功的任务中,我们学习机器人硬件的嵌入,并表明以硬件编码为条件的策略往往能很好地泛化和迁移。代码和视频可在项目网页上获取:https://sites.google.com/view/robot-transfer-hcp。

关键词

引用

@article{arxiv.1811.09864,
  title  = {Hardware Conditioned Policies for Multi-Robot Transfer Learning},
  author = {Tao Chen and Adithyavairavan Murali and Abhinav Gupta},
  journal= {arXiv preprint arXiv:1811.09864},
  year   = {2019}
}