FlowVQA:基于流程图映射多模态逻辑的视觉问答
计算与语言
2024-07-01 v2 计算机视觉与模式识别
信息检索
机器学习
摘要
现有视觉问答基准在视觉对齐性和复杂性方面存在不足,尤其在评估空间推理技能方面表现有限。我们提出 FlowVQA,一个新型基准,旨在评估视觉问答多模态语言模型在流程图作为视觉上下文时的推理能力。FlowVQA 包含 2,272 个经过精心生成和人工验证的流程图图像,来自三个不同内容来源,以及 22,413 对多样化的问答对,用于测试信息定位、决策和逻辑推进等多种推理任务。我们对开源和专有多模态语言模型进行全面基准评估,并分析了方向偏差。结果表明,FlowVQA 作为推进多模态建模领域发展的重要工具具有巨大潜力,为提升模型在视觉与逻辑推理任务中的性能提供了聚焦且具挑战性的环境。
引用
@article{arxiv.2406.19237,
title = {FlowVQA: Mapping Multimodal Logic in Visual Question Answering with Flowcharts},
author = {Shubhankar Singh and Purvi Chaurasia and Yerram Varun and Pranshu Pandya and Vatsal Gupta and Vivek Gupta and Dan Roth},
journal= {arXiv preprint arXiv:2406.19237},
year = {2024}
}
备注
Accepted in ACL 2024 (Findings), 21 pages, 7 figures, 9 Tables