Dr.Academy:面向大型语言模型教育提问能力的基准测试
人工智能
2024-08-21 v1 计算与语言
计算机与社会
摘要
教师在传授知识和指导学习者方面发挥着重要作用,大型语言模型(LLM)作为潜在教育者的角色正成为一个重要的研究领域。认识到LLMs生成教育内容的能力可推动自动化和个性化学习的进步。尽管LLMs已被测试其理解和问题解决能力,但其教学能力仍鲜有探索。在教学中,提问是一项关键技能,可引导学生分析、评估和综合核心概念和原理。因此,我们的研究引入一个基准测试,以评估LLMs在教育中作为教师的提问能力,通过评估其生成的教育性问题。我们运用Anderson和Krathwohl的范畴,将其划分为通用、单学科和跨学科领域。我们将注意力从LLMs作为学习者转向LLMs作为教育者,通过引导其生成问题来评估其教学能力。我们应用四项指标,包括相关性、覆盖范围、代表性和一致性,对LLMs输出的教育质量进行评估。我们的结果表明,GPT-4在教学通用、人文和科学课程方面展现出显著潜力;Claude2似乎更适合作为跨学科教师。此外,自动评分与人类观点高度一致。
关键词
引用
@article{arxiv.2408.10947,
title = {Dr.Academy: A Benchmark for Evaluating Questioning Capability in Education for Large Language Models},
author = {Yuyan Chen and Chenwei Wu and Songzhou Yan and Panjun Liu and Haoyu Zhou and Yanghua Xiao},
journal= {arXiv preprint arXiv:2408.10947},
year = {2024}
}
备注
Accepted to ACL 2024