现实检验:基于大语言模型的驾驶情景真实性评估
软件工程
2024-03-18 v1
摘要
大语言模型(LLMs)正在展示出在文本生成、摘要和分类等任务中卓越的潜力。鉴于此类模型是在海量在线知识基础上训练的,我们假设LLMs能够评估由自动驾驶测试技术生成的驾驶情景是否真实,即是否与真实驾驶条件一致。为测试此假设,我们进行了经验评估,以评估LLMs在执行此任务方面的有效性和鲁棒性。该现实性检查是制定基于LLM的自动驾驶测试技术的重要步骤。对于我们的经验评估,我们从 \deepscenario(开放驾驶情景数据集)中选取了64个真实情景。随后,通过对其进行微小修改,我们创建了512个额外的真实情景,形成总计576个情景的 数据集。有了这个数据集,我们评估了三个LLMs(\gpt、\llama 和 \mistral)在评估驾驶情景真实性方面的鲁棒性。我们的结果显示:(1)总体而言,\gpt在几乎所有情景、道路和天气条件下都优于\llama和\mistral,表现出最高的鲁棒性;(2)\mistral表现一直最差;(3)\llama在特定条件下取得好结果;(4)道路和天气条件会影响LLMs的鲁棒性。
引用
@article{arxiv.2403.09906,
title = {Reality Bites: Assessing the Realism of Driving Scenarios with Large Language Models},
author = {Jiahui Wu and Chengjie Lu and Aitor Arrieta and Tao Yue and Shaukat Ali},
journal= {arXiv preprint arXiv:2403.09906},
year = {2024}
}