VisualPuzzles: 多模态推理评估从域知识中解耦
计算与语言
2025-05-01 v3
摘要
当前多模态基准测试常常将推理与领域特定知识混合在一起,使得在非专家环境下难以隔离和评估通用推理能力。为此,我们引入VisualPuzzles,一个针对视觉推理且刻意最小化依赖专业知识的基准测试。VisualPuzzles涵盖五类问题:算法推理、类比推理、演绎推理、归纳推理和空间推理。我们问题的一个主要来源是从中国公务员考试中手动翻译的逻辑推理题目。实验表明,VisualPuzzles在需求的专业知识和推理复杂度上均显著低于MMM等基准测试,从而更有利于评估真正的多模态推理。评估显示,最新的多模态大语言模型在VisualPuzzles上始终落后于人类水平;且在知识密集型基准测试上表现优异,并不一定能在以推理为导向、知识较轻的任务中取得成功。此外,推理增强措施(如以"思考"模式进行推理计算扩放)在不同模型和任务类型上的收益不一致,我们观察到模型规模与性能之间不存在明确的相关性。我们还发现,模型在VisualPuzzles上的推理与答题模式与以知识为主导的基准测试存在差异。VisualPuzzles为评估知识记忆和领域知识之外的推理能力提供了更清晰的视角。
引用
@article{arxiv.2504.10342,
title = {VisualPuzzles: Decoupling Multimodal Reasoning Evaluation from Domain Knowledge},
author = {Yueqi Song and Tianyue Ou and Yibo Kong and Zecheng Li and Graham Neubig and Xiang Yue},
journal= {arXiv preprint arXiv:2504.10342},
year = {2025}
}
备注
56 pages, 43 figures