中文

VisNumBench:评估多模态大语言模型数感知能力

计算机视觉与模式识别 2025-08-01 v2

摘要

多模态大语言模型(Multimodal Large Language Models, MLLMs)是否能够发展出类似人类的直观数感知能力?针对此问题,我们引入Visual Number Benchmark(VisNumBench)来评估MLLMs在广泛范围内视觉数值任务中的数感知能力。VisNumBench由约1900个多选问答对组成,这些问答对源自合成数据和真实世界视觉数据,涵盖七种视觉数值属性和四种视觉数值估计任务类型。我们对VisNumBench上的实验得出以下关键发现:(i)我们测试的17个MLLMs,包括开源模型如Qwen2.5-VL和InternVL2.5,以及专有模型如GPT-4o和Gemini 2.0 Flash,在数感知相关任务中的表现显著低于人类水平。(ii)多模态数学模型和多模态链式思考(chain-of-thought, CoT)模型在数感知能力上未显示出显著的改进。(iii)参数更大、拥有更广泛通用能力的更强MLLMs在数感知能力上表现出适度的提升。我们相信VisNumBench将为研究社区提供一个宝贵的资源,鼓励进一步发展以提升MLLMs数感知能力。代码和数据集均可在https://wwwtttjjj.github.io/VisNumBench/上获取。

关键词

引用

@article{arxiv.2503.14939,
  title  = {VisNumBench: Evaluating Number Sense of Multimodal Large Language Models},
  author = {Tengjin Weng and Jingyi Wang and Wenhao Jiang and Zhong Ming},
  journal= {arXiv preprint arXiv:2503.14939},
  year   = {2025}
}

备注

accepted by ICCV 2025