通过专家引导策略优化实现安全驾驶
人工智能
2021-11-02 v2 机器人学
摘要
在学习驾驶等常见技能时,初学者通常有领域专家在一旁确保学习过程的安全。我们将这种学习方案形式化为专家在环强化学习(Expert-in-the-loop Reinforcement Learning),其中引入一个守护者来保障学习智能体的探索安全。在允许于不确定环境中充分探索的同时,守护者在危险情况下进行干预并演示正确动作以避免潜在事故。因此 ERL 将探索和专家的部分演示作为两个训练来源。遵循该设定,我们开发了一种新颖的专家引导策略优化(EGPO)方法,将守护者整合进强化学习的循环中。守护者由用于生成演示的专家策略以及决定何时干预的切换函数组成。特别地,使用约束优化技术来解决智能体故意表现危险以欺骗专家接管的平凡解问题。进一步利用离线 RL 技术从专家生成的部分演示中学习。安全驾驶实验表明,我们的方法实现了优越的训练与测试时安全性,在样本效率上大幅优于基线,并在测试时保持了对未见环境的泛化能力。演示视频与源代码见:https://decisionforce.github.io/EGPO/
引用
@article{arxiv.2110.06831,
title = {Safe Driving via Expert Guided Policy Optimization},
author = {Zhenghao Peng and Quanyi Li and Chunxiao Liu and Bolei Zhou},
journal= {arXiv preprint arXiv:2110.06831},
year = {2021}
}