中文

MathDuels:评估LLM作为问题提出者与解题者的综合基准

计算与语言 2026-04-28 v2 软件工程

摘要

随着前沿语言模型在静态数学基准测试中接近性能上限,现有的评估方法日益无法区分模型能力,主要因为它们仅将模型作为固定问题集的解题者。我们提出MathDuels,一个自我对弈基准,让模型在两个角色中轮流作战:每一位作者在对抗性提示下编写数学问题,并解答由其他所有参与者编写的每个问题。问题通过三个阶段的生成流程产生(元提示、问题生成和难度放大),并由独立验证器验证以排除格式错误的问题。我们采用Rasch模型(Rasch, 1993)联合估计解题者能力和问题难度;作者质量由每个模型所编写问题的难度推导得出。跨19个前沿模型的实验表明,编写和解题能力存在部分解耦,双角色评估揭示了在单角色基准中难以察觉的能力分离。随着新模型的加入,它们产生的问题能击败此前占主导地位的解题者,因此基准的难度会随参与者水平的提升而不断提升,而不是在固定天花板上饱和。我们提供公开排行榜,随新模型发布而更新。

关键词

引用

@article{arxiv.2604.21916,
  title  = {MathDuels: Evaluating LLMs as Problem Posers and Solvers},
  author = {Zhiqiu Xu and Shibo Jin and Shreya Arya and Mayur Naik},
  journal= {arXiv preprint arXiv:2604.21916},
  year   = {2026}
}