基于LLM的高级数学问题解决基准:标记级重生成与领域偏置
机器学习
2025-01-29 v1
摘要
大型语言模型(LLM)在许多自然语言任务中表现出色,但在复杂的数学问题解决方面仍面临挑战,尤其是在符号推理和维持一致输出方面。本研究评估了10个参数量在7至8 billion规模的LLM,针对945道来自MATH数据集的竞赛级别问题进行测试。重点考察了其生成可执行Python代码作为推理过程步骤的能力,涉及超过9,450次代码执行。研究引入了使用mistral-large-2411对答案进行5分制评分的评估框架,以解决数学符号不一致的问题。还考察了按标记级重生成对结果细化的影响。研究结果显示,顶尖商业模型(gpt-4o-mini,得分83.7%)与最低效的开源模型(open-codestral-mamba:v0.1,得分49.2%)之间存在高达34.5%的性能差距。这一差距在数论等复杂领域尤为明显。尽管按标记级重生成略微提高了llama3.1:8b模型的准确率(+0.8%),同时还减少了代码执行时间36.7%,这凸显了效率与精度之间的权衡。本研究还发现,问题难度越高,所有模型的准确率越低。尽管使用受控执行环境,生成代码的安全问题比例仍小于1%,且在10次尝试后仍有3.17%的问题未被解决,这表明混合推理方法可能具有优势。
引用
@article{arxiv.2501.17084,
title = {Token-by-Token Regeneration and Domain Biases: A Benchmark of LLMs on Advanced Mathematical Problem-Solving},
author = {Evgenii Evstafev},
journal= {arXiv preprint arXiv:2501.17084},
year = {2025}
}
备注
8 pages, 8 figures