中文

PRiSM:基于 Python 验证的代理式多模态科学推理基准

人工智能 2025-12-08 v1

摘要

在科学领域如数学和物理中评估视觉语言模型(VLM)面临独特挑战,这些挑战远超预测最终答案的范围。这些领域需要概念理解、符号推理和遵循形式法则的能力,而大多数现有基准未能满足这些要求。特别是,当前数据集往往是静态的,缺乏中间推理步骤、对变化的鲁棒性,或用于验证科学正确性的机制。为此,我们引入PRiSM,这是一个用于通过以 Python 为 grounding 方式评估科学推理的全动态多模态基准。PRiSM包含超过 24,750 题大学水平的物理和数学问题,利用我们的可扩展代理式管道 PrismAgent 生成结构良好的问题实例。每个问题包含动态的文本和视觉输入、生成的图表,以及丰富的结构化输出:可执行的 Python 代码用于生成和验证真实答案,以及详细的分步推理。基准的动态特性和 Python 驱动的自动化真实答案生成允许对多模态 VLM 进行细粒度的实验审计,揭示其失败模式、不确定性行为以及科学推理的局限性。为此,我们提出了五个针对性评估任务,涵盖泛化、符号程序综合、扰动鲁棒性、推理纠正和模糊性解决。通过对现有 VLM 的全面评估,我们突显了其局限性,并展示了 PRiSM如何实现对其科学推理能力的更深入洞察。

关键词

引用

@article{arxiv.2512.05930,
  title  = {PRiSM: An Agentic Multimodal Benchmark for Scientific Reasoning via Python-Grounded Evaluation},
  author = {Shima Imani and Seungwhan Moon and Adel Ahmadyan and Lu Zhang and Kirmani Ahmed and Babak Damavandi},
  journal= {arXiv preprint arXiv:2512.05930},
  year   = {2025}
}