中文

距离标注交通感知问答基准(DTPQA)

计算机视觉与模式识别 2026-05-15 v2 人工智能

摘要

视觉语言模型在各种任务上的显著进步,推动了其在自动驾驶领域的应用。然而,要在此类安全关键领域中可信地使用这些模型,首先必须具备稳健的感知能力,即能够理解可能高度复杂且多事物同时发生的交通场景。此外,由于关键对象和代理往往位于较远距离,因此需要不仅在近距离(最高 20 米)具有强大的感知能力,还在远距离(30 米以上)具有感知能力。因此,重要的是在其他技能(如推理或先进的世界知识)之外,独立评估这些模型的感知能力。距离标注交通感知问答(DTPQA)是一个特定于此目的的视觉问答(VQA)基准,能够用于评估在交通情景中使用平凡但关键与驾驶决策相关的问题的 VLMs 感知系统。它由两个部分组成:一个使用模拟器创建的合成基准(DTP-Synthetic),以及基于现有真实交通场景图像构建的真实世界基准(DTP-Real)。此外,DTPQA 包括距离标注,即问题中相关对象相对于相机的距离。更具体地说,每个 DTPQA 样本由以下要素组成(至少):(a) 一张图像,(b) 一个问题,(c) ground truth 回答,以及 (d) 问题中相关对象的距离,从而 enable 对 VLMs 性能随对象距离增加而恶化进行分析。本文提供了数据集本身以及用于创建它的 Python 脚本,可用于生成相同类型的额外数据。

关键词

引用

@article{arxiv.2511.13397,
  title  = {Descriptor: Distance-Annotated Traffic Perception Question Answering (DTPQA)},
  author = {Nikos Theodoridis and Tim Brophy and Reenu Mohandas and Ganesh Sistu and Fiachra Collins and Anthony Scanlan and Ciaran Eising},
  journal= {arXiv preprint arXiv:2511.13397},
  year   = {2026}
}