HAIM-DRL:用于安全高效自动驾驶的增强型人在回路强化学习
机器学习
2024-06-18 v5 人工智能
机器人学
摘要
尽管自动驾驶车辆(AVs)取得了显著进展,但确保 AVs 安全性和交通流效率的驾驶策略开发尚未得到充分探索。在本文中,我们提出了一种增强型人在回路强化学习方法,称为基于人类作为 AI 导师的深度强化学习(HAIM-DRL)框架,该框架有助于在混合交通队列中实现安全高效的自动驾驶。从人类学习过程中汲取灵感,我们首先引入了一种创新的学习范式,有效地将人类智能注入 AI,称为人类作为 AI 导师(HAIM)。在此范式中,人类专家充当 AI 智能体的导师。在允许智能体充分探索不确定环境的同时,人类专家可以在危险情况下接管控制并演示正确动作以避免潜在事故。另一方面,可以引导智能体最小化交通流干扰,从而优化交通流效率。具体而言,HAIM-DRL 利用从自由探索和部分人类演示中收集的数据作为其两个训练来源。值得注意的是,我们规避了手动设计奖励函数的复杂过程;相反,我们直接从部分人类演示中推导出代理状态-动作值来指导智能体的策略学习。此外,我们采用了一种最小干预技术来减轻人类导师的认知负荷。比较结果表明,HAIM-DRL 在驾驶安全性、采样效率、交通流干扰缓解以及对未见交通场景的泛化能力方面均优于传统方法。本文的代码和演示视频可访问:https://zilin-huang.github.io/HAIM-DRL-website/。
引用
@article{arxiv.2401.03160,
title = {HAIM-DRL: Enhanced Human-in-the-loop Reinforcement Learning for Safe and Efficient Autonomous Driving},
author = {Zilin Huang and Zihao Sheng and Chengyuan Ma and Sikai Chen},
journal= {arXiv preprint arXiv:2401.03160},
year = {2024}
}
备注
Accepted by Communications in Transportation Research