AI 聊天机器人在经典力学相对论新概念量表上的表现与失败模式
物理教育
2026-05-12 v1
摘要
AI 聊天机器人越来越多地被学生用作物理学的学习工具,这引发了关于它们在概念任务上可靠性的实际问题。现有对大型语言模型(LLMs)在物理概念量表上的评估几乎完全依赖于已公开可用多年且很可能出现在模型训练数据中的工具,这使得难以将物理能力与对测试题目本身的熟悉程度区分开来。我们通过在经典相对论概念量表(CRCI)上评估三个前沿 LLMs(GPT-5.2、Gemini 3 Pro、Gemini 3 Flash)来解决这一问题,CRCI 是一个近期开发并经过验证的 21 题伽利略相对论工具,在测试时尚未公开。每个题目对每个模型进行 30 次测试,所有 1890 个回答沿三个维度进行了定性编码:视觉解释、物理推理和协调。Gemini 3 Flash 的平均准确率为 97%,Gemini 3 Pro 为 89%,GPT-5.2 为 73%,而学生样本(N = 267)为 62%。然而,所有三个模型在少数题目上完全失败。定性分析表明,这些失败主要源于对视觉内容的误解,而非物理知识的匮乏,并且 LLM 的错误在结构上与学生的错误不同:当模型出错时,它们会高度一致地收敛于单一干扰项,而学生的错误分布更广。这些发现表明,聊天机器人在概念物理上的可靠性依赖于题目且不可预测,这对概念量表的实施方式具有直接启示。
引用
@article{arxiv.2605.09602,
title = {Performance and failure modes of AI chatbots on a novel concept inventory on relativity in classical mechanics},
author = {Eugenio Tufino and Caterina Giovanzana and Andrea Zamboni and Pasquale Onorato and Stefano Oss},
journal= {arXiv preprint arXiv:2605.09602},
year = {2026}
}
备注
19 pages,3 figures, 2 tables, supplementary material included