面向视觉语言模型的认知推理基准测试
计算机视觉与模式识别
2025-04-02 v3 人工智能
计算与语言
信息检索
摘要
认知文本和视觉推理任务,包括拼图、系列和类比,要求快速推理、解密和评估文本和空间中的模式。由于在广泛的人类精选数据上的大量训练,大语言模型 (LLM) 和视觉语言模型 (VLM) 在常见常识推理任务中表现出色,但仍在需要更深层次认知理解的复杂推理方面受限。我们引入 NTSEBench,一个新的数据集,用于评估大型模型的认知多模态推理和问题解决能力。该数据集包含 2728 个多选问题,配有 4642 张图片,分为 26 种不同类型。这些问题来自印度全国 NTSE 考试,包含视觉和文本通用 aptitude 挑战,旨在评估超越机械记忆的智力和批判性思维能力。我们使用最先进的 LLM 和 VLM 在数据集上建立了基线。为便于比较开源和专有模型,我们提出了四种不同的建模策略来处理数据集实例中的不同模态——文本和图像。
引用
@article{arxiv.2407.10380,
title = {NTSEBENCH: Cognitive Reasoning Benchmark for Vision Language Models},
author = {Pranshu Pandya and Vatsal Gupta and Agney S Talwarr and Tushar Kataria and Dan Roth and Vivek Gupta},
journal= {arXiv preprint arXiv:2407.10380},
year = {2025}
}
备注
28 pages, 3 figures, 12 tables