中文

从标准到复杂:基准测试大型语言模型在 undergrad 热力学中的能力

物理教育 2025-09-01 v1 计算与语言 化学物理

摘要

大型语言模型(LLMs)越来越被视为科学教育中的辅导工具。然而,它们在无人使用的情况下准备好用于 undergrad 指令中仍存不确定性,因为可靠的教学需要不仅仅是流畅的记忆:它需要一致的、以原则为基础的推理。热力学,由于其紧凑的定律和在状态函数与路径函数、可逆性以及熵之间细微区别,提供了一个理想的测试环境,用于评估此类能力。本文提出了UTQA,一个包含50个 undergrad 热力学问题的问答基准,涵盖理想气体过程、可逆性和图表解释。没有任何2025年时代的领先模型超过我们的95%能力阈值:最好的LLMs实现了82%的准确率,文本-only 项目在MLLMs方面表现更好,而图像推理任务往往降至机会水平。提示措辞和句法复杂性与性能显示有限到不显著的相关性。这一差距集中在有限速率/不可逆情景以及将视觉特征绑定到热力学意义上,表明当前的LLMs尚不适合用于无人辅导此领域。

关键词

引用

@article{arxiv.2508.21452,
  title  = {From Canonical to Complex: Benchmarking LLM Capabilities in Undergraduate Thermodynamics},
  author = {Anna Geißler and Luca-Sophie Bien and Friedrich Schöppler and Tobias Hertel},
  journal= {arXiv preprint arXiv:2508.21452},
  year   = {2025}
}

备注

Benchmark downloadable at https://huggingface.co/datasets/herteltm/UTQA