GanitBench:用于评估视觉语言模型中数学推理的双语基准
计算与语言
2025-08-07 v1 人工智能
摘要
过去几年中,越来越多地被用于评估视觉语言模型(VLM)在多个领域和领域的推理能力的基准正在不断构建。然而,这些基准通常是单语的,主要以英文形式提供。此外,关于在除理解和翻译之外的其他任务上提供的印地语数据集也很少。我们介绍GanitBench,一个包含1527个视觉问题的艰巨基准,涵盖数学中的多个主题,提供英文和印地语两种语言版本。该基准数据来源于印度的两个主要考试:JEE Advanced 和 CBSE 板考试,包含以图像形式呈现的问题,图像中包含构成问题所必需的图形以及文本。我们对两种闭源模型进行了评估,采用零-shot 和两-shot 链路思考(Chain-of-Thought, CoT)设置进行测试。发现 GPT-4o mini 在该基准上表现最为突出,其最高平均准确率为 38.15%。我们还通过一种“双锁”约束对模型进行了评估,该约束会使模型性能下降相当显著。我们观察到,在这种环境下,两-shot CoT 似乎是更有效的设置。两种 VLM 在用印地语回答相同问题时性能也会下降。我们希望通过我们的工作,促进类似印地语等语言在研究中的包含。
关键词
引用
@article{arxiv.2508.03737,
title = {GanitBench: A bi-lingual benchmark for evaluating mathematical reasoning in Vision Language Models},
author = {Ashutosh Bandooni and Brindha Subburaj},
journal= {arXiv preprint arXiv:2508.03737},
year = {2025}
}
备注
6 pages, 3 figures. Accepted, Presented and Published as part of Proceedings of the 6th International Conference on Recent Advantages in Information Technology (RAIT) 2025