真实驾驶场景中基于检索的交错式视觉思维链
计算机视觉与模式识别
2025-04-09 v2 人工智能
摘要
虽然思维链(CoT)提示提高了大语言模型的推理能力,但其在视觉语言模型(VLM)中的有效性仍然有限,因为过度依赖文本线索和记忆知识。为了研究VLM在复杂真实场景中的视觉推理能力,我们引入了DrivingVQA,一个源自驾驶理论考试的视觉问答数据集,包含3,931个多项选择题,附有专家编写的解释和与推理过程相关的基础实体。利用该数据集,我们提出了RIV-CoT,一种基于检索的交错式视觉思维链方法,使VLM能够利用与这些相关实体对应的视觉裁剪进行推理。我们的实验表明,与普通CoT提示相比,RIV-CoT将答案准确率提高了3.1%,推理准确率提高了4.6%。此外,我们证明,通过利用自动生成的伪标签,我们的方法可以有效地扩展到更大的A-OKVQA推理数据集,性能优于CoT提示。
引用
@article{arxiv.2501.04671,
title = {Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios},
author = {Charles Corbière and Simon Roburin and Syrielle Montariol and Antoine Bosselut and Alexandre Alahi},
journal= {arXiv preprint arXiv:2501.04671},
year = {2025}
}
备注
Project page: https://vita-epfl.github.io/DrivingVQA