EduAdapt:用于评估 LLM 阶梯级适应性的问答基准数据集
计算与语言
2025-10-21 v1 人工智能
摘要
大语言模型(LLM)正在通过回答问题、解释复杂概念和生成内容来变革教育领域,涵盖广泛的学科。尽管在学术基准测试上表现优异,但它们常常难以根据学生的年级水平调整响应。在 K-12 教育中,年龄适合的词汇和解释对于有效学习至关重要。现有的模型经常生成对年轻学习者过于高级或模糊的输出,且缺乏标准化基准来评估其跨认知和发展阶段的适应能力。为填补这一差距,我们引入 EduAdapt,一个涵盖近 48000 条带有年级标签的问答对数据集,覆盖九个科学学科,涵盖 1 至 12 年级,并按四个年级水平分组。我们对一套多样化的开源 LLM 在 EduAdapt 上的表现进行评估,发现尽管较大的模型通常表现更好,但它们仍在针对早期年级学生(1-5 年级)生成合适响应方面存在挑战。我们的工作提出了第一个用于评估 LLM 阶梯级适应性的数据集和评估框架,旨在通过更好的训练和提示策略,推动更贴合发展规律的教育 AI 系统的发展。EduAdapt 代码和数据集已公开 disponible at https://github.com/NaumanNaeem/EduAdapt。
引用
@article{arxiv.2510.17389,
title = {EduAdapt: A Question Answer Benchmark Dataset for Evaluating Grade-Level Adaptability in LLMs},
author = {Numaan Naeem and Abdellah El Mekki and Muhammad Abdul-Mageed},
journal= {arXiv preprint arXiv:2510.17389},
year = {2025}
}
备注
28 pages, 2 figures, 14 tables, 50 listings, EMNLP 2025 Main