通过人-AI 副驾驶优化实现安全驾驶策略的高效学习
机器学习
2022-02-22 v1 人工智能
机器人学
摘要
人类干预是将人类知识注入强化学习训练循环的有效方式,可带来快速学习并保障训练安全。在人为干预预算极为有限的情况下,设计人类专家何时及如何与学习智能体在训练中交互仍具挑战。本工作中,我们提出一种新颖的人机回路学习方法,称为人-AI 副驾驶优化(HACO)。为使智能体在危险环境中充分探索同时保障训练安全,人类专家可接管控制并演示如何避免可能危险的情形或琐碎行为。所提出的 HACO 随后有效利用来自试错探索与人工部分演示的数据来训练高性能智能体。HACO 从部分人类演示中提取代理状态-动作值,并优化智能体以提升代理值同时减少人类干预。实验表明,HACO 在安全驾驶基准中实现了极高的样本效率。HACO 能以少量人类干预预算训练智能体在未见交通场景中驾驶,并实现高安全性与泛化性,大幅优于强化学习与模仿学习基线。代码与演示视频见:https://decisionforce.github.io/HACO/。
引用
@article{arxiv.2202.10341,
title = {Efficient Learning of Safe Driving Policy via Human-AI Copilot Optimization},
author = {Quanyi Li and Zhenghao Peng and Bolei Zhou},
journal= {arXiv preprint arXiv:2202.10341},
year = {2022}
}
备注
Quanyi Li and Zhenghao Peng contribute equally to this work