GRAID:通过高保真数据生成增强视觉语言模型的空间推理
计算机视觉与模式识别
2025-10-29 v2 人工智能
摘要
视觉语言模型 (VLMs) 在许多视觉语言任务上取得强大的性能,但往往在空间推理方面困难——这是许多应用的必备条件。经验地,我们发现由当前训练数据生成管道产生的数据集仅有 57.6% 的人类验证通过率。这些通过率源于当前局限性:单图像 3D 重建引入级联建模误差且要求宽松的答案容忍度,而基于标题的方法需要详细的注释且受生成幻觉影响。我们提出 GRAID,其关键洞察在于:从 2D 几何原语即可可靠地确定定性空间关系。通过仅使用标准目标检测器提供的 2D 边界框,GRAID 规避了 3D 重建误差和生成幻觉,生成的数据集质量高于现有工具,经人类评估验证。我们将该框架应用于 BDD100k、NuImages 和 Waymo 数据集,生成超过 850 万个高质量 VQA 对,创建涵盖空间关系、计数、排序和大小比较的问题。我们评估其中一个数据集,发现其实现 91.16%的人类验证准确率——而最近工作生成的数据集仅为 57.6%。关键的是,我们证明在 GRAID 数据上训练的模型学习到可泛化的空间推理概念:在 6 种问题类型上微调的模型在超过 10 种 held-out 类型上均有改进,BDD 和 NuImages 上分别实现 47.5% 和 37.9% 的准确率提升(Llama 3.2B),而在所有问题类型上训练可在多个现有基准上取得改进,如 BLINK。GRAID 框架、数据集和其他信息可在 查找。
引用
@article{arxiv.2510.22118,
title = {GRAID: Enhancing Spatial Reasoning of VLMs Through High-Fidelity Data Generation},
author = {Karim Elmaaroufi and Liheng Lai and Justin Svegliato and Yutong Bai and Sanjit A. Seshia and Matei Zaharia},
journal= {arXiv preprint arXiv:2510.22118},
year = {2025}
}
备注
22 pages, 3 figures, 3 tables, project page: https://ke7.github.io/graid/