Mathador-LM:面向大语言模型数学推理的动态基准
计算与语言
2024-10-16 v3 人工智能
机器学习
摘要
我们引入了Mathador-LM,这是一个用于评估大语言模型(LLM)数学推理能力的新基准,它结合了规则集解释、规划和问题解决。该基准受Mathador游戏启发,其目标是使用给定基础数字集合上的基本算术运算,遵循一组简单规则,达到一个目标数字。我们表明,在领先的LLM中,我们在根据目标难度级别动态生成基准实例时,获得了稳定的平均性能。因此,我们的基准缓解了对测试集泄露到训练数据中的担忧,这一问题常常削弱流行基准的有效性。此外,我们在Mathador-LM上对领先的开源和闭源LLM进行了全面评估。我们的研究结果表明,当代模型在Mathador-LM上表现不佳,得分显著低于普通三年级学生的平均水平。这与它们在流行的数学推理基准上的强劲表现形成鲜明对比。Mathador-LM基准的实现可在\href{https://github.com/IST-DASLab/Mathador-LM}{github.com/IST-DASLab/Mathador-LM}获取。
引用
@article{arxiv.2406.12572,
title = {Mathador-LM: A Dynamic Benchmark for Mathematical Reasoning on Large Language Models},
author = {Eldar Kurtic and Amir Moeini and Dan Alistarh},
journal= {arXiv preprint arXiv:2406.12572},
year = {2024}
}
备注
EMNLP 2024