LLMs 准备好了吗?面向计算机科学教育的跨领域、跨语言与认知层次评估——基于专业认证考试
计算机与社会
2026-04-09 v1
摘要
大语言模型(LLMs)越来越多地应用于计算机科学教育领域,用于辅导、内容生成和代码评估等任务。然而,与正式课程和认证标准对齐的系统性评估仍然有限。本研究使用来自六项认证考试(涵盖网络、办公应用和 Java 编程)的1068道题目构建数据集,对四种最新模型——GPT-5、DeepSeek-R1、Qwen-Plus 和 Llama-3.3-70B-Instruct——进行了基准测试。我们从语言(中文与英文)、基于布鲁姆教育目标分类学的认知层次、领域知识、置信度-准确性对齐以及输入掩码鲁棒性等维度评估了模型性能。结果显示,GPT-5 在英文认证考试中表现最佳,而 Qwen-Plus 在中文语境下表现更好。DeepSeek-R1 取得了最均衡的跨语言性能,而 Llama-3.3 在高阶推理和鲁棒性方面表现出明显局限。所有模型在更复杂的任务上表现均更差。这些发现为将 LLMs 整合到计算机科学教育中提供了实证支持,并为课程设计与评估提供了实践启示。
引用
@article{arxiv.2604.06898,
title = {Are LLMs Ready for Computer Science Education? A Cross-Domain, Cross-Lingual and Cognitive-Level Evaluation Using Professional Certification Exams},
author = {Chen Gao and Chi Liu and Zhengquan Luo and Dongfu Xiao and Maiying Sui and Sheng Shen and Congcong Zhu and Huajie Chen and Xuhan Zuo and Zongyuan Ge and Tianqing Zhu and Wanlei Zhou and Xiaotong Han},
journal= {arXiv preprint arXiv:2604.06898},
year = {2026}
}
备注
40 pages including Appendix