并非所有 LLM 推理器都等价
机器学习
2024-10-03 v1
摘要
我们研究了大语言模型在小学数学题 (GSM) 解题能力的深度。为此,我们评估它们在成对现有数学文字题上的表现,使得第二个问题的答案依赖于正确回答第一个问题。我们的发现揭示了大多数大语言模型中存在显著的推理差距,即解决组合式配对题与独立解答每个问题之间的性能差异。这种差距在较小的、更具成本效益且专注于数学的模型中更为显著。此外,指令调优配方和代码生成在不同规模的 LLM 中发挥不同的效果,而在 GSM 上进行微调可能导致任务过拟合。我们的分析表明,较大的推理差距并非源于测试集泄漏,而是由于对额外上下文的干扰和较差的第二跳推理。总体而言,尽管标准基准测试显示 LLM 在推理能力方面存在系统性差异。
引用
@article{arxiv.2410.01748,
title = {Not All LLM Reasoners Are Created Equal},
author = {Arian Hosseini and Alessandro Sordoni and Daniel Toyama and Aaron Courville and Rishabh Agarwal},
journal= {arXiv preprint arXiv:2410.01748},
year = {2024}
}