监督下的物理安全强化学习研究
机器学习
2019-01-23 v1 机器学习
摘要
本文探讨了如何将预先可用的控制策略 用作监督者,以更快速、更安全地为机器人训练新的学习控制策略 。在试验期间使用监督者策略和学习策略的加权平均值,初始时对监督者赋予更高权重,以便在学习策略仍然无效时允许安全且有用的物理试验。在此过程中,调整权重以偏向学习策略。随着权重的调整,学习网络必须进行补偿,以便在不同权重下给出安全且合理的输出。我们引入了一个先驱网络,该网络预先学习一个在计划的新权重下一步中表现与当前学习策略相似的策略;然后该先驱网络在下一组试验中替换当前学习网络。在 OpenAI Gym 中的实验证明了所提方法的有效性。
引用
@article{arxiv.1901.06576,
title = {Towards Physically Safe Reinforcement Learning under Supervision},
author = {Yinan Zhang and Devin Balkcom and Haoxiang Li},
journal= {arXiv preprint arXiv:1901.06576},
year = {2019}
}