GPT 参加 SAT:追踪学生考试难度与数学成绩的变化
计量经济学
2024-09-18 v1
摘要
学术能力评估测试(Scholastic Aptitude Test, SAT)对大学录取至关重要,但其有效性和相关性日益受到质疑。本文通过引入“转换控制”(Transformed Control)增强了合成控制方法,这是一种利用人工智能驱动的大型语言模型(Large Language Models, LLMs)生成对照组的新方法。我们利用 OpenAI 的 API 生成了一个对照组,其中 GPT-4(即 ChatGPT)在 2008 至 2023 年间每年参加多次 SAT 考试。该对照组有助于分析自 2008 年基线年以来 SAT 数学难度随时间的变化。利用平行趋势,我们计算了分数的平均差异(Average Difference in Scores, ADS)以评估高中生数学成绩的变化。我们的结果表明,随着时间的推移,SAT 数学部分的难度显著下降,同时学生的数学成绩也有所下降。分析显示,从 2008 年到 2023 年,SAT 数学的严谨性下降了 71 分,学生成绩下降了 36 分,导致学生平均数学成绩出现 107 分的总分歧。我们研究了数学能力下降的可能机制,如大学选拔标准的变化、屏幕时间的增加、分数膨胀以及青少年心理健康恶化。人口群体之间的差异显示,白人学生下降了 104 分,黑人学生下降了 84 分,亚裔学生下降了 53 分。男学生成绩下降了 117 分,而女学生下降了 100 分。
引用
@article{arxiv.2409.10750,
title = {GPT takes the SAT: Tracing changes in Test Difficulty and Math Performance of Students},
author = {Vikram Krishnaveti and Saannidhya Rawat},
journal= {arXiv preprint arXiv:2409.10750},
year = {2024}
}