评估大型语言模型在数据结构大学考试中的表现
计算与语言
2026-04-28 v1
摘要
本文对大型语言模型(LLM)在计算机科学(CS)数据结构考试问题上的表现进行全面评估。本工作引入了新的基准数据集,包含来自特拉维夫大学(TAU)的考试题目,旨在评估LLM处理闭合题和多选题能力。我们评估了OpenAI的GPT-4o和Anthropic的Claude 3.5这两款主流LLM,以及两款规模较小的模型Mathstral 7B和LLaMA 3 8B,在TAU考试基准测试中的表现。我们的发现为了解当前LLM在计算机科学教育中的能力提供了洞见。
引用
@article{arxiv.2604.23347,
title = {Evaluating Large Language Models on Computer Science University Exams in Data Structures},
author = {Edan Gabay and Yael Maoz and Jonathan Stahl and Naama Maoz and Abdo Amer and Orr Eilat and Hanoch Levy and Michal Kleinbort and Amir Rubinstein and Adi Haviv},
journal= {arXiv preprint arXiv:2604.23347},
year = {2026}
}