大型语言模型在计算机科学学位项目中的表现
计算机与社会
2023-08-07 v1 人工智能
计算与语言
摘要
ChatGPT-3.5 和 GPT-4.0 等大型语言模型无处不在,并主导着当前的讨论。它们具有变革性的能力,使我们与(基于文本的)信息交互和利用的方式发生了范式转变。每天都会出现利用这些模型能力的新可能。本文展示了不同大型语言模型在一所应用科学大学计算机科学本科课程中的表现研究结果。我们的主要目标是通过将这些模型作为教育辅助工具,评估它们在课程中的有效性。通过使用讲义材料、练习任务和过往考试对模型进行提示,我们旨在评估它们在不同计算机科学领域的熟练程度。我们展示了当前大型语言模型的强劲表现,同时指出了在此类学位项目背景下的局限与约束。我们发现,ChatGPT-3.5 在 10 个被测模块中平均获得总分的 79.9%,BingAI 为 68.4%,而 650 亿参数版本的 LLaMa 为 20%。尽管结果令人信服,但即便是 GPT-4.0 也无法通过该学位项目——原因在于数学计算方面的局限。
引用
@article{arxiv.2308.02432,
title = {Performance of Large Language Models in a Computer Science Degree Program},
author = {Tim Krüger and Michael Gref},
journal= {arXiv preprint arXiv:2308.02432},
year = {2023}
}
备注
Submitted to AI4AI Workshop 2023