中文

QEDBench:量化大学水平数学证明自动评估中的对齐差距

机器学习 2026-03-03 v2

摘要

随着大型语言模型 (LLM) 在基础基准测试上实现饱和,研究前沿已从生成转向自动评估的可靠性。我们展示了标准的 "LLM 作为裁判" 协议在应用于大学上层 undergrad 至早期研究生水平的数学证明时存在系统性的对齐差距。为量化此差距,我们引入 QEDBench,这是一个大型双 Rubric 对齐基准,旨在通过对比课程特定 Rubric 与专家常识准则来系统衡量与人类专家的对齐程度。通过在 1000+ 小时的人类评估中部署双评估矩阵(7 位裁判 x 5 位求解器),我们揭示了某些前沿评估器如 Claude Opus 4.5、DeepSeek-V3、Qwen 2.5 Max 和 Llama 4 Maverick 存在显著的正偏差(分别最多高出 +0.18、+0.20、+0.30、+0.36 平均分增幅)。此外,我们发现离散领域存在关键推理差距:尽管 Gemini 3.0 Pro 实现了最佳性能(0.91 平均人类评估得分),但其他推理模型如 GPT-5 Pro 和 Claude Sonnet 4.5 在离散领域的表现显著下降。具体而言,其在离散数学和图论中的平均人类评估得分分别降至 0.72 和 0.63,以及 0.74 和 0.50。除上述研究结果外,我们还公开了 QEDBench 作为用于评估和改进 AI 裁判的公共基准。我们的基准已公开发布于 https://github.com/qqliu/Yale-QEDBench。

关键词

引用

@article{arxiv.2602.20629,
  title  = {QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs},
  author = {Santiago Gonzalez and Alireza Amiri Bavandpour and Peter Ye and Edward Zhang and Ruslans Aleksejevs and Todor Antić and Polina Baron and Sujeet Bhalerao and Shubhrajit Bhattacharya and Zachary Burton and John Byrne and Hyungjun Choi and Nujhat Ahmed Disha and Koppany István Encz and Yuchen Fang and Robert Joseph George and Ebrahim Ghorbani and Alan Goldfarb and Jing Guo and Meghal Gupta and Stefano Huber and Annika Kanckos and Minjung Kang and Hyun Jong Kim and Dino Lorenzini and Levi Lorenzo and Tianyi Mao and Giovanni Marzenta and Ariane M. Masuda and Lukas Mauth and Ana Mickovic and Andres Miniguano-Trujillo and Antoine Moulin and Wenqi Ni and Tomos Parry and Kevin Ren and Hossein Roodbarani and Mathieu Rundström and Manjil Saikia and Detchat Samart and Rebecca Steiner and Connor Stewart and Dhara Thakkar and Jeffrey Tse and Vasiliki Velona and Yunhai Xiang and Sibel Yalçın and Jun Yan and Ji Zeng and Arman Cohan and Quanquan C. Liu},
  journal= {arXiv preprint arXiv:2602.20629},
  year   = {2026}
}