中文

RealCQA-V2:面向科学图表的结构化视觉蕴含诊断基准

人工智能 2026-03-25 v3

摘要

多模态推理模型通常能生成流畅的答案,并伴有看似连贯的推理过程。现有基准仅评估最终答案的正确性。它们不支持对中间步骤,特别是视觉组合逻辑,进行原子级的视觉蕴含验证。这一限制在科学图表理解中尤为突出,因为答案依赖于确定性基础视觉语义,如坐标轴、图例和定量关系。我们引入了RealCQA-V2,这是一个大规模基准,它将图表问答重新构建为视觉前提证明:一项基于图表基础视觉谓词的结构化逻辑蕴含任务。每个问题都被分解为手动策划的、基于图表元素(坐标轴、图例、标记和定量关系)的原子前提,从而产生可执行的推理链,而非自由形式的文本推理过程。这些前提形成组合推理链,使得能够在单个视觉陈述和完整推理序列的层面上进行验证。我们引入了链级度量,用于衡量完整的逻辑有效性(AccVPP)以及失败链内的部分推理进展(DCP),超越了传统的VQA准确率。跨代表性LVLM的基线评估揭示了一个一致的局部-全局推理差距:模型通常能正确验证许多单个前提,但无法在整个链中保持连贯性。RealCQA-V2为真实科学图表上的结构化视觉蕴含建立了一个可复现的基准,并能够对超越仅答案评估的多模态推理进行严格诊断。

关键词

引用

@article{arxiv.2410.22492,
  title  = {RealCQA-V2: A Diagnostic Benchmark for Structured Visual Entailment over Scientific Charts},
  author = {Saleem Ahmed and Srirangaraj Setlur and Venu Govindaraju},
  journal= {arXiv preprint arXiv:2410.22492},
  year   = {2026}
}

备注

Under Review : Code and Data will be made public soon - https://cse-ai-lab.github.io/VPP/