ThermoQA:评估大型语言模型热力学推理的三级基准
人工智能
2026-04-23 v1 计算与语言
机器学习
摘要
我们提出了 ThermoQA,一个包含 293 道开放式工程热力学问题的三级基准测试:物性查询(110 题)、组件分析(101 题)和全循环分析(82 题)。真实值通过程序化计算自 CoolProp 7.2.0 获得,涵盖水、R-134a 和变比热容(variable-cp)空气。我们对六个前沿 LLM 各进行了三次独立运行的评估。综合排行榜由 Claude Opus 4.6 (94.1%)、GPT-5.4 (93.1%) 和 Gemini 3.1 Pro (92.5%) 领先。跨层级的性能下降范围从 2.8 pp (Opus) 到 32.5 pp (MiniMax),证实了物性记忆并不等同于热力学推理。超临界水、R-134a 制冷剂和联合循环燃气轮机分析作为天然区分项,表现出 40-60 pp 的性能差异。多次运行的标准差范围在 +/-0.1% 到 +/-2.5% 之间,将推理一致性量化为一个独立的评估维度。数据集和代码已在 https://huggingface.co/datasets/olivenet/thermoqa 开源。
引用
@article{arxiv.2604.19758,
title = {ThermoQA: A Three-Tier Benchmark for Evaluating Thermodynamic Reasoning in Large Language Models},
author = {Kemal Düzkar},
journal= {arXiv preprint arXiv:2604.19758},
year = {2026}
}
备注
17 pages, 8 figures, open-source dataset and code