面向自动驾驶的强化学习智能体风险感知奖励塑形
机器人学
2023-08-28 v2 人工智能
摘要
强化学习(RL)是自动驾驶中运动规划的一种有效方法,可通过与环境的交互数据自动学习最优驾驶策略。然而,对RL智能体性能至关重要的奖励函数难以确定。传统工作主要关注对安全驾驶状态给予奖励,却未纳入对车辆风险驾驶行为的感知。本文研究如何利用风险感知奖励塑形来提升自动驾驶中RL智能体的训练与测试性能。基于规定实际通用自动驾驶安全规范的必要要求,我们提出额外的重塑奖励项,以鼓励探索并惩罚风险驾驶行为。在OpenAI Gym中的仿真研究表明,风险感知奖励塑形对各种RL智能体具有优势。我们还指出,近端策略优化(PPO)很可能是与风险感知奖励塑形配合最佳的RL方法。
引用
@article{arxiv.2306.03220,
title = {Risk-Aware Reward Shaping of Reinforcement Learning Agents for Autonomous Driving},
author = {Lin-Chi Wu and Zengjie Zhang and Sofie Haesaert and Zhiqiang Ma and Zhiyong Sun},
journal= {arXiv preprint arXiv:2306.03220},
year = {2023}
}