面向安全优化的自主驾驶:基于 LLM 增强的 RLHF 人本中心方法
人工智能
2024-10-10 v1
摘要
从人类反馈中学习的强化学习(RLHF)在大型语言模型(LLMs)中备受推崇,而传统强化学习(RL)往往不尽如意。当前自主驾驶方法通常要么利用人类反馈进行机器学习(包括 RL),要么使用 LLMs。大多数反馈指导车辆代理的学习过程(例如控制车辆)。RLHF 通常在微调阶段应用,要求直接的人类“偏好”,而这在优化自主驾驶模型时并不常见。本研究创新性地将 RLHF 与 LLMs 结合,以增强自主驾驶的安全性。从头训练模型需要人类指导效率低下。我们的框架从预训练的自主车辆模型开始,并实现多个由人类控制的代理(如车辆和行人),以模拟真实路环境。自主车辆模型不直接受人类控制。我们集成了物理反馈和生理反馈,对模型进行微调,以优化这一过程。这种多代理交互环境确保了在实际应用之前的安全、真实交互。最后,我们将使用来自新泽西和纽约市测试场收集的数据来验证我们的模型。
引用
@article{arxiv.2406.04481,
title = {Optimizing Autonomous Driving for Safety: A Human-Centric Approach with LLM-Enhanced RLHF},
author = {Yuan Sun and Navid Salami Pargoo and Peter J. Jin and Jorge Ortiz},
journal= {arXiv preprint arXiv:2406.04481},
year = {2024}
}