中文

基于人类反馈强化学习的真实交通仿真

人工智能 2023-09-06 v1 机器学习 机器人学

摘要

鉴于现实世界测试的挑战与成本,自动驾驶开发者常依赖仿真测试来构建可靠系统。有效仿真的一个关键要素是融入符合人类认知的真实交通模型,由于在真实性与多样性之间需取得平衡,这方面已被证明颇具挑战。本研究旨在通过开发一个采用人类偏好强化学习(RLHF)以增强现有交通模型真实性的框架来解决此问题。本研究还确定了两个主要挑战:捕捉人类对真实性的偏好细微差别,以及统一多样化的交通仿真模型。为应对这些问题,我们提出使用人类反馈进行对齐,并因其样本效率而采用 RLHF。我们还引入了首个用于交通建模中真实性对齐的数据集以支持此类研究。我们的框架名为 TrafficRLHF,展现出生成与人类偏好高度一致的真实交通场景的能力,这一点在 nuScenes 数据集上的综合评估中得到证实。

关键词

引用

@article{arxiv.2309.00709,
  title  = {Reinforcement Learning with Human Feedback for Realistic Traffic Simulation},
  author = {Yulong Cao and Boris Ivanovic and Chaowei Xiao and Marco Pavone},
  journal= {arXiv preprint arXiv:2309.00709},
  year   = {2023}
}

备注

9 pages, 4 figures