中文

评估大型语言模型在数据结构大学考试中的表现

计算与语言 2026-04-28 v1

摘要

本文对大型语言模型(LLM)在计算机科学(CS)数据结构考试问题上的表现进行全面评估。本工作引入了新的基准数据集,包含来自特拉维夫大学(TAU)的考试题目,旨在评估LLM处理闭合题和多选题能力。我们评估了OpenAI的GPT-4o和Anthropic的Claude 3.5这两款主流LLM,以及两款规模较小的模型Mathstral 7B和LLaMA 3 8B,在TAU考试基准测试中的表现。我们的发现为了解当前LLM在计算机科学教育中的能力提供了洞见。

关键词

引用

@article{arxiv.2604.23347,
  title  = {Evaluating Large Language Models on Computer Science University Exams in Data Structures},
  author = {Edan Gabay and Yael Maoz and Jonathan Stahl and Naama Maoz and Abdo Amer and Orr Eilat and Hanoch Levy and Michal Kleinbort and Amir Rubinstein and Adi Haviv},
  journal= {arXiv preprint arXiv:2604.23347},
  year   = {2026}
}