中文

Mathador-LM:面向大语言模型数学推理的动态基准

计算与语言 2024-10-16 v3 人工智能 机器学习

摘要

我们引入了Mathador-LM,这是一个用于评估大语言模型(LLM)数学推理能力的新基准,它结合了规则集解释、规划和问题解决。该基准受Mathador游戏启发,其目标是使用给定基础数字集合上的基本算术运算,遵循一组简单规则,达到一个目标数字。我们表明,在领先的LLM中,我们在根据目标难度级别动态生成基准实例时,获得了稳定的平均性能。因此,我们的基准缓解了对测试集泄露到训练数据中的担忧,这一问题常常削弱流行基准的有效性。此外,我们在Mathador-LM上对领先的开源和闭源LLM进行了全面评估。我们的研究结果表明,当代模型在Mathador-LM上表现不佳,得分显著低于普通三年级学生的平均水平。这与它们在流行的数学推理基准上的强劲表现形成鲜明对比。Mathador-LM基准的实现可在\href{https://github.com/IST-DASLab/Mathador-LM}{github.com/IST-DASLab/Mathador-LM}获取。

关键词

引用

@article{arxiv.2406.12572,
  title  = {Mathador-LM: A Dynamic Benchmark for Mathematical Reasoning on Large Language Models},
  author = {Eldar Kurtic and Amir Moeini and Dan Alistarh},
  journal= {arXiv preprint arXiv:2406.12572},
  year   = {2024}
}

备注

EMNLP 2024