巨人与精灵:不同规模大语言模型在自动驾驶场景生成中的代码生成比较研究
软件工程
2025-10-17 v1 机器学习
摘要
场景模拟是测试自动驾驶系统的核心任务。Scenic 作为针对 CARLA 的领域特定语言(DSL),能够实现场景的精确制定与可重复生成,但基于大语言模型(LLM)的 NL-to-Scenic 生成面临数据稀缺、可重复性有限以及指标不一致等挑战。我们引入 NL2Scenic,一个包含 146 组 NL/Scenic 配对的开放数据集与框架,配合难度分层的 30 案测试划分、示例检索器(Example Retriever)以及 14 种提示变体(ZS、FS、CoT、SP、MoT)。我们评估了 13 个模型:四个专有模型(GPT-4o、GPT-5、Claude-Sonnet-4、Gemini-2.5-pro)和九个开源代码模型(Qwen2.5Coder 0.5B-32B;CodeLlama 7B/13B/34B),使用文本指标(BLEU、ChrF、EDIT-SIM、CrystalBLEU)和执行指标(编译与生成),并与专家研究(n=11)进行对比。EDIT-SIM 与人类判断最相关;我们还提出 EDIT-COMP(EDIT-SIM 与编译结果的 F1 分数)作为鲁棒的数据集级代理指标,以提升排序保真度。GPT-4o 综合表现最佳,Qwen2.5Coder-14B 在本地硬件上达到约 88% 的专家得分。检索增强提示、基于示例检索器的 Few-Shot(FSER)能稳定提升小型模型的表现,规模化实验显示在中等规模模型之后存在边际递减,且 Qwen2.5Coder 在相当规模下超越 CodeLlama。NL2Scenic 与 EDIT-COMP 提供了评估 Scenic 代码生成的标准化、可重复基准,表明中等规模的开源模型是自动驾驶场景编程的实用、成本效益高的选择。
引用
@article{arxiv.2510.14115,
title = {David vs. Goliath: A comparative study of different-sized LLMs for code generation in the domain of automotive scenario generation},
author = {Philipp Bauerfeind and Amir Salarpour and David Fernandez and Pedram MohajerAnsari and Johannes Reschke and Mert D. Pesé},
journal= {arXiv preprint arXiv:2510.14115},
year = {2025}
}