中文

ZPD-SCA:揭示大语言模型在评估学生认知能力方面的盲点

计算与语言 2025-08-26 v2 人工智能 计算机与社会

摘要

大语言模型(LLMs)在教育应用中已展现出潜力,然而它们准确评估阅读材料与学生发展阶段之间认知匹配度的能力仍未得到充分探索。鉴于最近发展区(ZPD)这一基础教育原则强调学习资源需与学生认知能力(SCA)相匹配,这一研究空白尤为关键。尽管这种匹配至关重要,但目前明显缺乏全面研究来考察大语言模型评估不同年龄段学生阅读理解难度的能力,尤其是在中文教育背景下。为填补这一空白,我们引入了ZPD-SCA,一个专门设计用于评估学段级中文阅读理解难度的新型基准。该基准由60位特级教师(该群体代表全国在职教师的前0.15%)进行标注。实验结果表明,大语言模型在零样本学习场景下表现不佳,Qwen-max和GLM的表现甚至低于随机猜测的概率。当提供上下文示例时,大语言模型的性能显著提升,部分模型的准确率几乎达到其零样本基线的两倍。这些结果揭示了大语言模型具备评估阅读难度的涌现能力,同时也暴露了其当前训练在教育对齐判断方面的局限性。值得注意的是,即使是表现最佳的模型也显示出系统性的方向偏差,表明在将材料难度与SCA精确对齐方面存在困难。此外,模型在不同体裁上的显著性能差异凸显了任务的复杂性。我们期望ZPD-SCA能为评估和改进大语言模型在认知对齐的教育应用中奠定基础。

关键词

引用

@article{arxiv.2508.14377,
  title  = {ZPD-SCA: Unveiling the Blind Spots of LLMs in Assessing Students' Cognitive Abilities},
  author = {Wenhan Dong and Zhen Sun and Yuemeng Zhao and Zifan Peng and Jun Wu and Jingyi Zheng and Yule Liu and Xinlei He and Yu Wang and Ruiming Wang and Xinyi Huang and Lei Mo},
  journal= {arXiv preprint arXiv:2508.14377},
  year   = {2025}
}