OptLayer:面向真实世界深度强化学习的实用约束优化
机器人学
2018-02-26 v2 人工智能
摘要
尽管深度强化学习技术近期在诸多决策问题上取得了显著成就,但其在机器人领域的应用仍主要局限于仿真环境或受限运动,因为在真实世界中无约束的试错交互可能对机器人或其环境造成不良后果。为克服这些局限,我们提出了一种新颖的强化学习架构 OptLayer,它以神经网络预测的可能不安全的动作为输入,输出满足选定约束的最接近动作。在学习控制策略时,通常需要在探索可能动作范围的过程中精心设计奖励与惩罚,而 OptLayer 则确保只有安全动作被实际执行,并在训练期间对不安全预测进行惩罚。我们在仿真和真实世界的机器人到达任务上验证了该方法的有效性。
引用
@article{arxiv.1709.07643,
title = {OptLayer - Practical Constrained Optimization for Deep Reinforcement Learning in the Real World},
author = {Tu-Hoa Pham and Giovanni De Magistris and Ryuki Tachibana},
journal= {arXiv preprint arXiv:1709.07643},
year = {2018}
}
备注
To appear at ICRA 2018. Video: https://www.youtube.com/watch?v=7liBbk3VjWQ