中文

Mathify:在数学问题求解任务上评估大型语言模型

计算与语言 2024-04-23 v1 人工智能

摘要

自然语言处理(NLP)系统领域的快速进步以及大型语言模型(LLMs)的扩展,为教育和教学方法领域开辟了众多机会。这些进步提供了定制学习体验和即时反馈的潜力,所有这些都通过可访问且具有成本效益的服务来提供。这项技术进步的一个显著应用领域是求解数学问题。数学问题求解不仅需要破译复杂问题陈述的能力,还需要在问题求解过程的每一步执行精确算术计算的技能。然而,对大型语言模型算术能力的评估仍然是一个相对较少受到关注的领域。作为回应,我们引入了一个名为“MathQuest”的广泛数学数据集,该数据集来源于 11 年级和 12 年级数学 NCERT 教科书。该数据集包含不同复杂程度的数学挑战,涵盖了广泛的数学概念。利用该数据集,我们对三个著名的 LLMs 进行了微调实验:LLaMA-2、WizardMath 和 MAmmoTH。这些微调模型作为评估其在我们的数据集上性能的基准。我们的实验表明,在这三个模型中,MAmmoTH-13B 表现最为熟练,在求解所提出的数学问题方面达到了最高的能力水平。因此,MAmmoTH-13B 确立了自己作为解决 NCERT 数学问题的稳健且可靠的基准。

关键词

引用

@article{arxiv.2404.13099,
  title  = {Mathify: Evaluating Large Language Models on Mathematical Problem Solving Tasks},
  author = {Avinash Anand and Mohit Gupta and Kritarth Prasad and Navya Singla and Sanjana Sanjeev and Jatin Kumar and Adarsh Raj Shivam and Rajiv Ratn Shah},
  journal= {arXiv preprint arXiv:2404.13099},
  year   = {2024}
}

备注

10 pages, 3 figures, NeurIPS 2023 Workshop on Generative AI for Education (GAIED)