中文

RoadscapesQA:面向印度道路的多任务、多模态视觉问答数据集

计算机视觉与模式识别 2026-02-16 v1

摘要

理解路面场景对于自动驾驶至关重要,因为它使系统能够解释视觉环境以有效支持决策。我们提出Roadscapes,一个包含最多9000张图片的数据集,图片来自印度多样化的驾驶环境,并配有经过手动验证的边界框。为实现可扩展的场景理解,我们采用基于规则的启发式方法推断各种场景属性,这些属性随后用于生成question-answer(QA)对,以完成目标 grounding、reasoning 和 scene understanding 等任务。该数据集涵盖来自印度城市和农村的各种场景,包括高速公路、服务道、乡村小径以及拥堵的城市街道,拍摄于白天和夜晚。Roadscapes数据集已被精心策划,以推动视觉场景理解在非结构化环境中的研究。本文我们描述了数据收集和标注过程,呈现关键数据集统计信息,并提供使用视觉语言模型进行图像 QA任务的初始基线。

关键词

引用

@article{arxiv.2602.12877,
  title  = {RoadscapesQA: A Multitask, Multimodal Dataset for Visual Question Answering on Indian Roads},
  author = {Vijayasri Iyer and Maahin Rathinagiriswaran and Jyothikamalesh S},
  journal= {arXiv preprint arXiv:2602.12877},
  year   = {2026}
}