中文

用于评估大型语言模型在判断驾驶情景真实性方面鲁棒性的基准工具

软件工程 2025-11-07 v1

摘要

近年来,自动驾驶系统取得了显著进展,但确保其安全性仍是关键挑战。情景基准测试提供了实用解决方案,仿真方法因实际测试成本高昂和风险大而受到青睐。然而,评估模拟情景的真实性仍然困难,亟需有效的评估方法。近期进展表明,大型语言模型(LLM)具备强大的推理和泛化能力,表明其在通过情景相关文本提示评估情景真实性方面具有潜力。基于此,我们提出DriveRLR,一个用于评估LLM在判断驾驶情景真实性方面鲁棒性的基准工具。DriveRLR生成变异情景变体,构建提示词,用于评估给定LLM判断驾驶情景真实性能力和鲁棒性的能力。我们在DeepScenario数据集上使用三个最先进的LLM:GPT-5、Llama 4 Maverick和Mistral Small 3.2进行验证。结果表明,DriveRLR有效揭示了不同LLM鲁棒性差异,展示了其在情景真实性评估方面的有效性和实际价值。除了LLM鲁棒性评估,DriveRLR可作为用于引导情景生成的客观函数,支持仿真基准ADS测试工作流程。

关键词

引用

@article{arxiv.2511.04267,
  title  = {A Tool for Benchmarking Large Language Models' Robustness in Assessing the Realism of Driving Scenarios},
  author = {Jiahui Wu and Chengjie Lu and Aitor Arrieta and Shaukat Ali},
  journal= {arXiv preprint arXiv:2511.04267},
  year   = {2025}
}