中文

从解答者到辅导员:基于 KMP-Bench 评估大语言模型的教育智能

计算与语言 2026-03-04 v1 机器学习

摘要

大型语言模型在人工智能数学辅导领域展现出巨大潜力,但现有评估往往依赖简单指标或狭窄的教育情景,无法全面评估多轮教学效果。本文引入 KMP-Bench,这是一个综合性的 K-8 数学教育基准测试,旨�从两个互补的视角评估大语言模型。第一个模块 KMP-Dialogue 通过构建由多样化教育组件编织而成的新型多轮对话数据集,评估模型在六大核心原则(如挑战、解释、反馈)下的整体教育能力。第二个模块 KMP-Skills 对基础辅导能力进行细粒度评估,包括多轮问题解决、错误检测与纠正、问题生成等。我们的评估结果显示:领先的大语言模型在解答可验证解答的任务中表现出色,但在细腻的教育原则应用上仍有不足。此外,我们还提供了大规模(15万)对话数据集 KMP-Pile。经 KMP-Pile 微调后,模型在 KMP-Bench 上取得显著提升,凸显了丰富教育训练数据的价值,对于开发更有效的 AI 数学辅导器至关重要。

关键词

引用

@article{arxiv.2603.02775,
  title  = {From Solver to Tutor: Evaluating the Pedagogical Intelligence of LLMs with KMP-Bench},
  author = {Weikang Shi and Houxing Ren and Junting Pan and Aojun Zhou and Ke Wang and Zimu Lu and Yunqiao Yang and Yuxuan Hu and Linda Wei and Mingjie Zhan and Hongsheng Li},
  journal= {arXiv preprint arXiv:2603.02775},
  year   = {2026}
}