中文

针对迭代式错误纠正与空间感知提示的 Argoverse2 场景挖掘挑战技术报告

计算机视觉与模式识别 2025-06-16 v1 软件工程

摘要

从大规模自动驾驶数据集(如 Argoverse 2)中进行场景挖掘,是开发和验证自主驾驶系统的关键任务。RefAV 框架通过采用大语言模型(LLM)将自然语言查询翻译为可执行代码,以识别相关场景,显示出巨大的潜力。然而,该方法面临两个挑战:(1)源自LLM生成代码的运行时错误;(2)对描述复杂多对象空间关系的函数参数解释不准确。本技术报告介绍了两项关键改进:(1)容错的迭代代码生成机制,通过错误反馈重新提示LLM来完善代码;(2)针对空间关系函数的专业化提示工程。我们在 Argoverse 2 验证数据集上使用多种LLM(Qwen2.5-VL-7B、Gemini 2.5 Flash 和 Gemini 2.5 Pro)进行实验,结果在多个指标上均取得一致提升;最显著的是,使用 Gemini 2.5 Pro 时,本系统在官方测试集上实现了52.37的 HOTA-Temporal 分数。这些结果凸显了所提出技术在可靠、高精度场景挖掘中的有效性。

关键词

引用

@article{arxiv.2506.11124,
  title  = {Technical Report for Argoverse2 Scenario Mining Challenges on Iterative Error Correction and Spatially-Aware Prompting},
  author = {Yifei Chen and Ross Greer},
  journal= {arXiv preprint arXiv:2506.11124},
  year   = {2025}
}