中文

ReasoningWeekly:面向大型语言模型的通用知识与语言推理挑战

人工智能 2025-12-01 v4 机器学习

摘要

现有前沿模型基准测试通常测试专业的、需要非专家难以理解的“博士级”知识。相比之下,我们提出了一个包含613个问题的数据集,基于NPR Sunday Puzzle Challenge,仅需通用知识。该基准对人类和模型都具备挑战性;然而,正确解答容易验证,模型的错误也容易被发现。随着大型语言模型在社会中更广泛地部署,我们认为为前沿模型开发可被人类理解而无需深入领域专业知识的基准测试是有用的。我们的工作揭示了一些在现有基准测试中难以察觉的能力缺口:OpenAI o1在本基准测试中显著优于其他推理模型,尽管在测试专业知识基准时与其他模型持平。进一步地,我们分析了推理输出,发现了新的错误类型。例如,DeepSeek R1常在知道答案错误前就放弃回答;R1在输出中也常常表现出“不确定”,且在极少数情况下,模型甚至“未完成思考”,这表明需要技术手段在上下文窗口限制到期前“收尾”。我们还量化了延长推理时间对在本基准测试中准确率提升的效果,从而确定更多推理不太可能提高准确率的点。

关键词

引用

@article{arxiv.2502.01584,
  title  = {ReasoningWeekly: A General Knowledge and Verbal Reasoning Challenge for Large Language Models},
  author = {Zixuan Wu and Francesca Lucchetti and Aleksander Boruch-Gruszecki and Jingmiao Zhao and Carolyn Jane Anderson and Joydeep Biswas and Federico Cassano and Arjun Guha},
  journal= {arXiv preprint arXiv:2502.01584},
  year   = {2025}
}