OrdinalBench:诊断视觉语言模型中序数数字理解泛化极限的基准数据集
计算机视觉与模式识别
2026-03-10 v1
摘要
视觉语言模型(VLMs)在多模态基准测试中取得了显著进展,但在序数数字理解方面仍表现明显不足,即跟踪相对位置并泛化到大指数的能力。我们提出 OrdinalBench,一个标准化序数数字理解作为 VLMs 评估任务的诊断基准。核心任务是 N-th 目标识别,由起始参考点和遍历规则定义。任务难度沿三个维度控制:(i) 序数大小,从小数字到最高达300的极端情况;(ii) 排列复杂度,从单一循环到迷宫式路径;(iii) 目标数量。基准提供 39,000 个问答对,每个问答对都标注了 ground-truth 推理轨迹,并在难度水平上得到平衡,以实现受控的大规模测试。除了仅进行答案评估外,我们的框架要求模型生成计数过程的结构化逐步轨迹,并提供一个开放的评估工具包,衡量最终准确率和步骤级别的路径一致性。GPT-5、Gemini 2.5 Flash Lite、Qwen2.5-VL、InternVL3.5 和 Molmo 的零样本评估显示,在大序数和复杂路径条件下性能显著下降,尽管在标准多模态任务中得分很高,凸显了其在序列推理方面的弱点。通过将序数数字理解设定为核心目标,OrdinalBench 提供了一个可复现的基准和诊断框架,用于开发更强大的 VLMs。所有数据和代码均可在 https://ordinalbench.github.io/ 获取。
引用
@article{arxiv.2603.07786,
title = {OrdinalBench: A Benchmark Dataset for Diagnosing Generalization Limits in Ordinal Number Understanding of Vision-Language Models},
author = {Yusuke Tozaki and Hisashi Miyamori},
journal= {arXiv preprint arXiv:2603.07786},
year = {2026}
}
备注
Accepted as a Short Paper at VISAPP 2026