大语言模型在改进概率学习方面的潜力:基于 ChatGPT3.5 与计算机工程大一学生的研究
计算与语言
2023-10-10 v1 人工智能
摘要
在本文中,我们评估了大规模语言模型 ChatGPT(2023年2月版)在解决计算机工程入门考试中典型概率问题上的效能。我们的研究包含一组 23 道概率练习题,施测于马德里 Rey Juan Carlos 大学(URJC)的学生。ChatGPT 生成的回答由五位统计学教授评估,他们进行定性评价并依据用于学生的相同标准打分。我们的结果表明,ChatGPT 在表述、组织和逻辑推理方面优于学生平均水平。该模型在练习题的西班牙语和英语版本上表现一致。然而,ChatGPT 在执行基本数值运算时遇到困难。我们的实验表明,要求 ChatGPT 以 R 脚本形式提供解决方案被证明是克服这些限制的有效方法。总之,我们的结果表明 ChatGPT 在解决计算机工程入门考试中常见的概率问题方面优于学生平均水平。尽管如此,该模型在某些概率概念的推理上表现出局限性。该模型提供高质量解释并能以任意编程语言阐释解决方案的能力,加上其在解决概率练习上的表现,表明大语言模型有潜力作为学习助手。
引用
@article{arxiv.2310.05686,
title = {The potential of large language models for improving probability learning: A study on ChatGPT3.5 and first-year computer engineering students},
author = {Angel Udias and Antonio Alonso-Ayuso and Ignacio Sanchez and Sonia Hernandez and Maria Eugenia Castellanos and Raquel Montes Diez and Emilio Lopez Cano},
journal= {arXiv preprint arXiv:2310.05686},
year = {2023}
}
备注
10 pages, 6 figures, 4 tables