基于人类反馈强化学习的混合交通中自动驾驶车辆换道研究
计算工程、金融与科学
2024-08-09 v1
摘要
自动驾驶领域的蓬勃发展要求自动驾驶车辆(AV)与人类驾驶车辆无缝集成,这需要更可预测的 AV 行为以及增强的与人类驾驶员的交互。类人驾驶,特别是在高速公路上的换道操作,因其对安全和交通流的显著影响而成为一个关键研究领域。传统的基于规则的决策方法往往无法涵盖不同驾驶场景中人类行为的细微边界,而为基于学习的方法设计奖励函数则引入了其自身的复杂性。本研究探讨了应用基于人类反馈的强化学习(RLHF)来模拟 AV 中的类人换道决策。首先预训练一个初始强化学习策略以确保安全换道。随后,利用该策略收集数据,并由人类进行标注,以训练一个能够识别符合人类偏好的换道行为的奖励模型。这个由人类信息指导的奖励模型取代了原始模型,引导策略的优化以反映类人偏好。通过在障碍物丰富的环境和混合自主交通场景中开发和评估保守与激进换道模型,展示了 RLHF 在产生类人换道行为方面的有效性。实验结果强调了 RLHF 在多样化 AV 换道行为方面的潜力,表明其在增强 AV 融入人类驾驶交通体系方面的可行性。
引用
@article{arxiv.2408.04447,
title = {Reinforcement Learning from Human Feedback for Lane Changing of Autonomous Vehicles in Mixed Traffic},
author = {Yuting Wang and Lu Liu and Maonan Wang and Xi Xiong},
journal= {arXiv preprint arXiv:2408.04447},
year = {2024}
}