生成式 AI 参加统计学考试:对比 ChatGPT3.5、ChatGPT4 与 ChatGPT4o-mini 的表现
其他统计学
2025-06-12 v1 机器学习
摘要
许多人认为,将生成式 AI 作为私人辅导员有潜力缩小资源丰富的学校与资源较少的学校之间的学习机会和成就差距。只有当付费版和免费版平台在准确性方面表现一致时,缩小差距才有可能实现。本实验考察了 GPT 3.5、4.0 和 4o-mini 在由第一年研究生学生接受的 16 题统计学考试中的表现。虽然我们不主张使用任何生成式 AI 平台完成考试,但使用考试题目允许我们探讨 ChatGPT 对学生在统计学课程中可能遇到的典型问题的响应方式。准确性结果表明,GPT 3.5 会失败考试,GPT4 表现良好,GPT4o-mini 则处于中间水平。尽管我们承认其他生成式 AI/大语言模型的存在,但本文讨论仅涉及 ChatGPT,因为它是目前在大学校园中最广泛使用的平台。我们进一步探讨了 AI 平台在每个问题答案中的差异,采用文本分析方法,如阅读水平评估和主题建模。结果表明,GPT3.5 和 4o-mini 的特征与 GPT4 相比更相似。
引用
@article{arxiv.2501.09171,
title = {Generative AI Takes a Statistics Exam: A Comparison of Performance between ChatGPT3.5, ChatGPT4, and ChatGPT4o-mini},
author = {Monnie McGee and Bivin Sadler},
journal= {arXiv preprint arXiv:2501.09171},
year = {2025}
}
备注
24 pages, 2 figures, 3 tables. Submitted for publication August, 2024; revision submitted January 2025