中文

MathTutorBench:衡量大语言模型教学能力的开放基准

计算与语言 2025-10-14 v2 人工智能 机器学习

摘要

评估基于 AI 的辅导模型在指导性进展方面的教学能力至关重要。然而,我们缺乏一种可靠、易用且易于运行的评估方法,能够反映模型的教学能力。为填补这一空白,我们提出了 MathTutorBench,这是一个用于全面性辅导模型评估的开放基准。MathTutorBench 包含一系列数据集和指标,广泛涵盖由学习科学研究在对话式教学中所定义的辅导能力。为对开放式教师响应的教学质量进行评分,我们训练了一个奖励模型,并展示它能够以高准确率区分专家教师响应与初学者教师响应。我们在 MathTutorBench 上评估了广泛的封闭式和开放式权重模型,发现主体专业知识(即解题能力)并不直接转化为良好的教学。相反,教学能力与主体专业知识似乎形成一种权衡,这由模型教学专业化程度所决定。此外,随着对话长度的增加,教学变得更加具有挑战性,在这种情况下,较简单的提问策略开始失效。我们公开发布了基准测试、代码和排行榜,以便快速对未来模型进行基准测试。

关键词

引用

@article{arxiv.2502.18940,
  title  = {MathTutorBench: A Benchmark for Measuring Open-ended Pedagogical Capabilities of LLM Tutors},
  author = {Jakub Macina and Nico Daheim and Ido Hakimi and Manu Kapur and Iryna Gurevych and Mrinmaya Sachan},
  journal= {arXiv preprint arXiv:2502.18940},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 Main as an oral presentation. Website: https://eth-lre.github.io/mathtutorbench