中文

意识到(语言)鸿沟:探究数值与跨语言 LVLMs 的限制

计算机视觉与模式识别 2025-08-27 v2 人工智能 计算与语言 机器学习

摘要

我们提出了 MMCRICBENCH-3K,一个用于基于膳食分数卡的视觉问答(VQA)基准测试,旨在评估大型视觉语言模型(LVLMs)在半结构化表格图像上的复杂数值与跨语言推理能力。MMCRICBENCH-3K 包含 1,463 张人工生成的比赛卡图像,覆盖 ODI、T20 和 Test 三种格式,配有 1,500 组英文问答对。该数据集包含两个子集:MMCRICBENCH-E-1.5K 包含英文比赛卡,MMCRICBENCH-H-1.5K 包含视觉上相似的印地语比赛卡,所有问题和答案均为英文,以实现受控的跨脚本评估。该任务需要对结构化数值数据进行推理、跨多图像进行上下文理解,并依赖隐式的领域知识。经验结果表明,尽管 GPT-4o 和 Qwen2.5VL 等最先进的 LVLMs 在英文子集上表现不佳,尽管这是其主要训练语言,在印地语子集上表现进一步下降。这揭示了结构感知视觉文本理解、数值推理和跨语言泛化的关键局限性。该数据集通过 Hugging Face 在 https://huggingface.co/datasets/DIALab/MMCricBench 公开,旨在推动此方向的 LVLM 研究。

关键词

引用

@article{arxiv.2508.17334,
  title  = {Mind the (Language) Gap: Towards Probing Numerical and Cross-Lingual Limits of LVLMs},
  author = {Somraj Gautam and Abhirama Subramanyam Penamakuri and Abhishek Bhandari and Gaurav Harit},
  journal= {arXiv preprint arXiv:2508.17334},
  year   = {2025}
}