中文

提高多模态 LLM 在几何问题解决、推理与多步骤评分方面的能力

人工智能 2024-12-03 v1

摘要

本文提出了 GPSM4K,一个针对增强大型视觉语言模型 (LVLMs) 在几何问题解决方面能力的全面几何多模态数据集。GPSM4K 包含 2157 个从小学 7 至 12 年级数学教材中手工提取的多模态问答对,进一步扩充至 5340 个问题,包括数值问题和定理证明问题。与仅包含客观类型问题的 PGPS9k、Geometry3K 和 Geo170K 不同,GPSM4K 提供了以一致格式的详细步骤解决方案,促进了对问题解决方法的全面评估。该数据集是评估 LVLMs 几何推理能力的优秀基准。我们对测试集进行评估,显示开源语言模型在几何问题解决方面仍有提升空间。在我们的训练集上微调可提高模型的几何问题解决能力。进一步地,我们还评估了诸如图像描述和检索增强生成 (RAG) 等技术对模型性能的有效性。我们利用 LLM 自动化最终答案评估任务,通过提供ground truth 和预测解来实现。本研究将帮助评估和提高 LVLMs 的几何推理能力。

关键词

引用

@article{arxiv.2412.00846,
  title  = {Improving Multimodal LLMs Ability In Geometry Problem Solving, Reasoning, And Multistep Scoring},
  author = {Avinash Anand and Raj Jaiswal and Abhishek Dharmadhikari and Atharva Marathe and Harsh Parimal Popat and Harshil Mital and Kritarth Prasad and Rajiv Ratn Shah and Roger Zimmermann},
  journal= {arXiv preprint arXiv:2412.00846},
  year   = {2024}
}

备注

15 pages