量子力学大语言模型评估:跨模型与任务的比较研究
人工智能
2026-02-24 v1 量子物理
摘要
我们present对大规模语言模型在量子力学问题解决方面的系统评估。我们的研究评估了来自 OpenAI、Anthropic、Google、Alibaba、DeepSeek 的 15 个模型,跨越三个能力层级,在覆盖推导、创造性问题、非标准概念和数值计算的 20 项任务上进行,包括 900 项基准和 75 项工具增强评估。结果揭示了清晰的层级分层:旗舰模型实现 81% 的平均准确率,超越中等层级(77%)和快速模型(67%)分别高出 4pp 和 14pp。任务难度模式呈现差异显著:推导表现最佳(平均 92%,旗舰模型 100%),而数值计算最具挑战性(42%)。工具增强对数值任务产生任务依赖性效应:在 3 倍 token 成本下实现整体 modest 改善(+4.4pp),但掩盖了从 +29pp 收益到 -16pp 退步的显著异质性。可重复性分析在三次运行中量化了 6.3pp 的平均方差,旗舰模型表现出色(GPT-5 实现零方差),而专门模型需要多运行评估。该工作贡献:(i) 一个带自动验证的量子力学基准,(ii) 量化层级性能层级的系统评估,(iii) 工具增强权衡的实证分析,以及 (iv) 可重复性特征描述。所有任务、验证器和结果均公开发布。
引用
@article{arxiv.2602.19006,
title = {Evaluating Large Language Models on Quantum Mechanics: A Comparative Study Across Diverse Models and Tasks},
author = {S. K. Rithvik},
journal= {arXiv preprint arXiv:2602.19006},
year = {2026}
}