AI 系统在 AP 物理考试中的表现如何:大型语言模型在代数基础免答题上的比较评估
物理教育
2026-03-10 v1
摘要
大型语言模型 (LLM) 的快速发展产生了日益增长的兴趣,其在物理教育和评估中的潜在作用尚未得到充分探索。本研究系统评估了四个广受欢迎的 AI 系统——ChatGPT 4.1 mini、Gemini 2.5 Flash、Claude 4.0 Sonnet 和 DeepSeek R1-on 在 2015-2025 年间 administered 的 AP Physics 1 和 2 免答题上的表现。模型生成的解答在标准化的考试风格提示下生成,并由三位独立的物理专家根据官方 College Board 评分指南进行评估。所有模型在代数结构问题解决方面取得了相当高的平均得分 (82-92%),表明其在结构化代数问题解决方面具有强大的能力。然而,观察到显著的年份间变异性,特别是针对 AP Physics 1,统计测试显示不同模型之间没有一致的性能等级。在 contrast 中,AP Physics 2 结果显示出统计学上的显著差异,Gemini 和 DeepSeek 的表现比 Claude 更为一致。定性分析揭示了所有模型中反复出现的错误模式,包括对图表和图的误解、错误的图构建、错误的关于向量方向的推理、电路拓扑错误、部分和误导的定性解释,以及在诸如右手定则等三维概念应用方面的困难。这些发现表明,虽然当代 AI 系统能够有效地支持常规物理问题解决,但它们在需要空间推理、视觉解释和概念集成的任务上仍受限。结果凸显了 AI 辅助学习工具在物理教育中的教学潜力以及当前的教育局限性。
引用
@article{arxiv.2603.07457,
title = {How Well Do AI Systems Solve AP Physics? A Comparative Evaluation of Large Language Models on Algebra-Based Free Response Questions},
author = {Bilas Paul and Jashandeep Kaur and Shantanu Chakraborty and Shruti Shrestha},
journal= {arXiv preprint arXiv:2603.07457},
year = {2026}
}
备注
10 pages, 3 figures