中文

GeomVerse:几何推理大模型的系统性评估

计算机视觉与模式识别 2023-12-20 v1 计算与语言

摘要

当输入问题仅为文本时,大型语言模型在多跳数学推理方面已展现出令人印象深刻的结果。然而,许多数学推理问题同时包含文本与图像。随着视觉语言模型(VLMs)的日益普及,理解其对此类问题的推理能力至关重要。本文通过几何问题的视角,沿多个维度评估 VLMs 的推理能力。我们以程序化方式创建了一个具有可控难度等级(沿多个维度)的几何问题合成数据集,从而实现系统性评估。利用我们的基准对最先进 VLMs 进行的实证结果表明,这些模型在几何等学科(以及通过泛化,其他需要类似推理的主题)上的能力并不像先前基准所暗示的那样强。我们的基准在不同深度层级上的构建使这一点尤为明显,因为解决更高深度的问题需要长链推理而非额外的记忆知识。我们发布该数据集以供该领域的进一步研究。

关键词

引用

@article{arxiv.2312.12241,
  title  = {GeomVerse: A Systematic Evaluation of Large Models for Geometric Reasoning},
  author = {Mehran Kazemi and Hamidreza Alvari and Ankit Anand and Jialin Wu and Xi Chen and Radu Soricut},
  journal= {arXiv preprint arXiv:2312.12241},
  year   = {2023}
}