中文

NSMQ谜语:面向大语言模型的科学数学谜语基准

计算与语言 2026-05-11 v1

摘要

大语言模型(LLMs)在 various science 教育基准测试中表现良好,显示出在科学和数学教育中应用的潜力。然而,LLMs 往往在来自西方世界的科学和数学教育数据集上进行评估,而在来自全球南方的基准数据集则存在欠表现。此外,这些数据集倾向于提供多选答案选项,评估较为简单。在本工作中,我们提出NSMQ谜语(NSMQ Riddles),即来自 Ghana 国家科学与数学竞赛(NSMQ)的科学与数学谜语基准,用于评估大语言模型。NSMQ 是每年举办的电视竞技赛,面向坡副中学生,选手以两人一队形式回答生物、化学、物理和数学问题,经过五轮五阶段的比赛,最终产生一支获胜团队。NSMQ谜语包含来自第五轮的 11 年间谜语问题(共 1800 余题),每题至少包含 3 条线索。学生需在任意一条线索上率先猜出答案,先行线索模糊且可获得更多分数。答案通常为数字、单词或简短短语,便于自动评估。我们评估了主流模型:闭源模型(GPT-5.4、Gemini 3.1 Pro、Claude Opus 4.6)和开源模型(Kimi-K2.5、DeepSeek-V3.1、GPT-OSS-120B),分别在高低推理设置下进行测试。我们的评估显示,该数据集对主流大语言模型同样具有挑战性,哪怕是最优秀的学生选手也未必能全线斩获。本工作为来自全球南方的科学与数学推理提供了新颖且具挑战性的基准,旨在促进大语言模型在科学与数学教育中能力的真正全球化评估。

关键词

引用

@article{arxiv.2605.07051,
  title  = {NSMQ Riddles: A Benchmark of Scientific and Mathematical Riddles for Quizzing Large Language Models},
  author = {George Boateng and Naafi Ibrahim and Samuel John and Philemon Badu and Patrick Agyeman-Budu and Jonathan Mensah and Kevin Yeboah and William Edor and Andrew Mensa-Onumah and Nana Yeboah and Victor Wumbor-Apin Kumbol},
  journal= {arXiv preprint arXiv:2605.07051},
  year   = {2026}
}

备注

15 pages. Accepted at the 27th International Conference on Artificial Intelligence in Education