ELI-Why:评估语言模型解释的教学效用
计算与语言
2025-06-18 v1 人机交互
摘要
当今语言模型在教育领域得到广泛应用,但其针对不同信息需求和知识背景的学习者进行响应的能力仍未得到充分探索。为此,我们引入 ELI-Why,这是一个包含 13.4K 个“为什么”问题的基准,用于评估语言模型的教学能力。我们随后进行两项大规模人类研究,以评估语言模型生成的解释性答案(解释)在我们的基准上的实用性,针对三个不同的教育年龄段:小学、中学和研究生。在我们的第一项研究中,人类评姆扮演“教育者”,评估模型解释是否符合不同的教育年龄段。我们发现 GPT-4 生成的解释仅匹配其预期教育背景的比例为 50%,而人类精心策划的解释为 79%。在我们的第二项研究中,人类评姆扮演学习者,评估解释是否符合其自身的信息需求。在所有教育背景下,用户平均认为 GPT-4 生成的解释比由普通人策划的解释不太合适 20%。此外,自动化评估指标显示,不同语言模型家族为不同信息需求生成的解释在其年龄段水平上几乎无异,这限制了其教学效用。
关键词
引用
@article{arxiv.2506.14200,
title = {ELI-Why: Evaluating the Pedagogical Utility of Language Model Explanations},
author = {Brihi Joshi and Keyu He and Sahana Ramnath and Sadra Sabouri and Kaitlyn Zhou and Souti Chattopadhyay and Swabha Swayamdipta and Xiang Ren},
journal= {arXiv preprint arXiv:2506.14200},
year = {2025}
}
备注
Findings of ACL 2025