Box-QAymo:面向自动驾驶的盲盒指代视觉问答数据集
计算机视觉与模式识别
2025-07-02 v1 人工智能
摘要
可解释的交互对于安全可靠的自动驾驶至关重要,但当前的视觉语言模型(VLM)常在理想化假设下运作,难以捕捉现实场景中用户意图。现有驾驶导向的VQA数据集局限于全场景描述或路径点预测,无法评估VLM是否能针对局部用户驱动查询作出响应。我们提出Box-QAymo,一种盲盒指代数据集和基准,旨在评估和微调VLM在用户指定对象上的空间与时序推理能力。用户通过绘制边界框表达意图,这提供了一种快速直观的界面,用于在复杂场景中进行聚焦查询。具体而言,我们提出了分层评估协议,首先进行二元常规性检查问题以评估基础模型能力,随后进行(1)盲盒指代对象的属性预测、(2)目标实例的运动理解,以及(3)跨帧中对象间动态的时空运动推理。为支持此目标,我们众包细粒度对象类别和视觉属性,反映驾驶员所遇到的复杂性,并提取对象轨迹以构建时序 grounding 的问答对。通过负采样、时序一致性检查和难度感知平衡等严格质量控制,确保数据集的稳健性和多样性。我们的全面评估揭示了当前VLM在感知类问题上的显著局限,凸显了实现现实性能之间的鸿沟。本工作为开发在现实条件下能与用户有效沟通的更稳健、可解释的自动驾驶系统提供了基础。项目页面和数据集可在 https://djamahl99.github.io/qaymo-pages/ 访问。
引用
@article{arxiv.2507.00525,
title = {Box-QAymo: Box-Referring VQA Dataset for Autonomous Driving},
author = {Djamahl Etchegaray and Yuxia Fu and Zi Huang and Yadan Luo},
journal= {arXiv preprint arXiv:2507.00525},
year = {2025}
}