多智能体城市驾驶环境中自主策略深度强化学习鲁棒性评估
人工智能
2023-03-24 v3 机器学习
多智能体系统
摘要
深度强化学习正被积极用于模拟驾驶环境中训练自动驾驶策略。由于各类强化学习算法大量可用且缺乏其在不同驾驶场景下的系统比较,我们尚不确定哪些算法在单智能体与多智能体驾驶环境中训练自动驾驶软件更为有效。用于基于视觉的自动驾驶中深度强化学习比较的基准框架将开启训练更优自动驾驶策略的可能。为应对这些挑战,我们提供了一个开放且可复用的基准框架,用于单智能体与多智能体环境下自动驾驶深度强化学习算法的系统评估与比较分析。利用该框架,我们对离散与连续动作空间深度强化学习算法进行了比较研究。我们还提出了一种专为基于深度强化学习的自动驾驶智能体评估设计的综合多目标奖励函数。我们在仅视觉的高保真城市驾驶模拟环境中运行实验。结果表明,仅在部分多智能体专用环境设置下训练时,仅有若干深度强化学习算法在单与多智能体场景中表现持续更优。例如,基于A3C和TD3的自动驾驶汽车在动作更鲁棒及驾驶错误最少方面于两类场景中均相对更优。我们得出结论:不同深度强化学习算法在不同场景中表现出不同的驾驶与测试性能,这凸显了对其系统比较分析的必要性。本文提出的基准框架促进了此类比较。
引用
@article{arxiv.2112.11947,
title = {Evaluating the Robustness of Deep Reinforcement Learning for Autonomous Policies in a Multi-agent Urban Driving Environment},
author = {Aizaz Sharif and Dusica Marijan},
journal= {arXiv preprint arXiv:2112.11947},
year = {2023}
}