GeomVerse:几何推理大模型的系统性评估
计算机视觉与模式识别
2023-12-20 v1 计算与语言
摘要
当输入问题仅为文本时,大型语言模型在多跳数学推理方面已展现出令人印象深刻的结果。然而,许多数学推理问题同时包含文本与图像。随着视觉语言模型(VLMs)的日益普及,理解其对此类问题的推理能力至关重要。本文通过几何问题的视角,沿多个维度评估 VLMs 的推理能力。我们以程序化方式创建了一个具有可控难度等级(沿多个维度)的几何问题合成数据集,从而实现系统性评估。利用我们的基准对最先进 VLMs 进行的实证结果表明,这些模型在几何等学科(以及通过泛化,其他需要类似推理的主题)上的能力并不像先前基准所暗示的那样强。我们的基准在不同深度层级上的构建使这一点尤为明显,因为解决更高深度的问题需要长链推理而非额外的记忆知识。我们发布该数据集以供该领域的进一步研究。
引用
@article{arxiv.2312.12241,
title = {GeomVerse: A Systematic Evaluation of Large Models for Geometric Reasoning},
author = {Mehran Kazemi and Hamidreza Alvari and Ankit Anand and Jialin Wu and Xi Chen and Radu Soricut},
journal= {arXiv preprint arXiv:2312.12241},
year = {2023}
}