使用深度强化学习在 ATRIAS 双足机器人上学习高层策略
机器人学
2018-10-01 v1
摘要
为双足机器人学习控制器是一个具有挑战性的问题,常需要专家知识以及在不同情况下变化的参数广泛调优。近来,深度强化学习在自动学习仿真中复杂系统控制器方面展现出前景。随后出现了朝向学习可在仿真与硬件间迁移的控制器的推动,主要借助域随机化。然而,域随机化会使寻找稳定控制器的问题更具挑战性,尤其对于欠驱动双足机器人。本工作中,我们探索借助高保真仿真器和结构化控制器,能否将仿真中学习的策略迁移至硬件。我们学习了一个作为更结构化控制器一部分的神经网络策略。虽然神经网络在仿真中学习,控制器其余部分保持固定,并可由专家按需调优。我们展示使用该方法可极大加快仿真中的学习速率,并能够实现仿真与硬件间策略的迁移。我们给出了在 ATRIAS 机器人上的结果,并探究了动作空间与代价函数对仿真与硬件间迁移速率的影响。我们的结果表明结构化策略确实可在仿真中学习并成功在硬件上实现。这具有若干优势,因为结构保留了策略的直观性,而神经网络提升了手工设计策略的性能。以此方式,我们提出了一种利用神经网络改进专家设计控制器、同时保持易理解性的途径。
引用
@article{arxiv.1809.10811,
title = {Using Deep Reinforcement Learning to Learn High-Level Policies on the ATRIAS Biped},
author = {Tianyu Li and Akshara Rai and Hartmut Geyer and Christopher G. Atkeson},
journal= {arXiv preprint arXiv:1809.10811},
year = {2018}
}
备注
Submitted to 2019 IEEE International Conference on Robotics and Automation