分层驾驶 VQA 中的跨阶段一致性:显式基线与学习型门控上下文投射
计算机视觉与模式识别
2026-04-27 v1 人工智能
摘要
图形视觉问答(GVQA)用于自动驾驶,将推理组织为有序的阶段,即感知、预测和规划,其中规划决策应保持与模型自身感知的一致性。我们提出了关于 DriveLM-nuScenes 上跨阶段上下文传递的比较研究,采用两种互补机制。显式变体在不进行额外训练的情况下,对基于域适应的 4B VLM(Mini-InternVL2-4B-DA-DriveLM)上的三种基于提示的条件策略进行评估,最大降低了 NLI 矛盾率最高可达 42.6%,并建立了一个强大的零训练基线。隐式变体引入了门控上下文投射器,从一个阶段提取隐藏状态向量,并将归一化的、加权的投射注入到下一个阶段的输入嵌入中。这些投射器在针对通用目的的 8B VLM(InternVL3-8B-Instruct)上的特定阶段 QLoRA 适配器中联合训练,仅更新约 0.5% 的参数。隐式变体在规划阶段 NLI 矛盾降低统计显著的 34%(bootstrap 95% 置信区间,p < 0.05),并将跨阶段蕴含度提高 50%,使用多语言 NLI 分类器进行评估,以考虑混合语言输出。规划语言质量也得到改善(CIDEr 提升 30.3%),但由于缺乏驾驶领域的预训练,词汇重叠和结构一致性下降。由于两种变体使用不同的基础模型,我们将其作为互补案例研究呈现:显式上下文传递为表层一致性提供了强大的无训练基线,而隐式门控投射为规划阶段语义提升提供了显著效果,表明领域适应是实现全方位改进的合理的下一步 ingredient。
引用
@article{arxiv.2604.22560,
title = {Cross-Stage Coherence in Hierarchical Driving VQA: Explicit Baselines and Learned Gated Context Projectors},
author = {Gautam Kumar Jain and Carsten Markgraf and Julian Stähler},
journal= {arXiv preprint arXiv:2604.22560},
year = {2026}
}
备注
16 pages, 8 figures, 8 tables, preprint