中文

利用大语言模型评估高等教育课程中的 21 世纪能力:性能基准测试与基于推理的提示策略

计算机与社会 2026-01-19 v1

摘要

高等教育对 21 世纪能力的日益强调,在生成式 AI 变革性影响的推动下愈发凸显,这突出了评估这些能力如何嵌入课程以及学术项目如何有效适应不断变化的劳动力与社会需求的必要性。课程分析,尤其是近期由生成式 AI 驱动的方法,提供了一条有前景的数据驱动路径。然而,分析 21 世纪能力需要超越表面信息检索的教学推理,而大语言模型在此背景下的能力仍有待探索。在本研究中,我们通过考察更广泛的课程文档、能力框架和模型,扩展了先前的课程分析研究。利用 7,600 个手动标注的课程-能力对齐分数,我们评估了不同课程来源的信息量,对通用大语言模型进行课程到能力的映射基准测试,并分析了错误模式。我们进一步引入了一种基于推理的提示策略 Curricular CoT,以增强大语言模型的教学推理能力。结果表明,详细的教学活动描述是用于能力分析的信息量最大的课程文档类型。开源权重大语言模型在粗粒度任务上取得了与专有模型相当的准确率,证明了其在机构应用中的可扩展性与成本效益。然而,在细粒度教学推理方面,没有模型达到人类水平的精确度。我们提出的 Curricular CoT 通过减少教学关键词推断中的偏差并改进长文本中细微教学证据的检测,取得了适度的改进。这些发现共同突出了机构课程文档的未开发潜力,并为推进 AI 驱动的课程分析提供了实证基础。

关键词

引用

@article{arxiv.2601.10983,
  title  = {Evaluating 21st-Century Competencies in Postsecondary Curricula with Large Language Models: Performance Benchmarking and Reasoning-Based Prompting Strategies},
  author = {Zhen Xu and Xin Guan and Chenxi Shi and Qinhao Chen and Renzhe Yu},
  journal= {arXiv preprint arXiv:2601.10983},
  year   = {2026}
}