通过元数据上下文接地与任务特定提示的鲁棒驾驶问答
计算机视觉与模式识别
2025-10-23 v1 人工智能
机器人学
摘要
我们提出了一种用于自动驾驶的两阶段视觉-语言 QA 系统,用于回答高级感知、预测和规划问题。在第一阶段,一个大型多模态 LLM(Qwen2.5-VL-32B)以六路相机输入、短时历史窗口以及带有少样本示例的思维链提示为条件。自洽性集成(多次采样的推理链)进一步提高了答案的可靠性。在第二阶段,我们用 nuScenes 场景元数据(目标标注、自车状态等)和类别特定的问题指令(针对感知、预测、规划任务的独立提示)来扩充提示。在驾驶 QA 基准上的实验中,我们的方法显著优于基线 Qwen2.5 模型。例如,在第一阶段使用 5 个历史帧和 10-shot 提示可获得 65.1% 的总体准确率(相比之下,zero-shot 为 62.61%);应用自洽性将其提升至 66.85%。第二阶段实现了 67.37% 的总体准确率。值得注意的是,该系统在严重的视觉损坏下仍保持 96% 的准确率。这些结果表明,精心设计的提示和上下文接地可以极大地增强预训练视觉-语言模型的高级驾驶 QA 能力。
引用
@article{arxiv.2510.19001,
title = {Robust Driving QA through Metadata-Grounded Context and Task-Specific Prompts},
author = {Seungjun Yu and Junsung Park and Youngsun Lim and Hyunjung Shim},
journal= {arXiv preprint arXiv:2510.19001},
year = {2025}
}