大语言模型驱动的高等教育课程评价探索
计算与语言
2025-12-29 v2 人工智能
计算机与社会
摘要
课程评价在确保教学质量与指导课程开发方面发挥着关键作用。然而,传统评价方法,如学生调查、课堂观察和专家评审,往往受到主观性、高人力成本和有限可扩展性的制约。随着大语言模型(LLMs)的最新进展,自动化生成一致、细致且可扩展的课程评价出现了新的机会。本研究探讨了三种代表性LLMs在微观层面(课堂讨论分析)和宏观层面(整体课程评审)两个维度进行自动化课程评价的能力。利用课堂互动转录文本和来自中国一所主要机构的100门课程数据集,我们证明LLMs能够提取关键教学特征并生成与专家判断一致的结构化评价结果。微调后的Llama版本展现出优越的可靠性,产生的评分分布具有更强的区分度,并与人类评估者表现出更强的相关性。结果揭示了三个主要发现:(1) LLMs能够在微观和宏观两个层面可靠地执行系统且可解释的课程评价;(2) 微调和提示工程显著提升了评价的准确性与一致性;(3) LLM生成的反馈为教学改进提供了可操作的见解。这些发现展示了基于LLM的评价作为支持大规模高等教育环境中质量保证和教育决策的实用工具的潜力。
引用
@article{arxiv.2411.02455,
title = {An Exploration of Higher Education Course Evaluation by Large Language Models},
author = {Bo Yuan and Jiazi Hu},
journal= {arXiv preprint arXiv:2411.02455},
year = {2025}
}