TPS-CalcBench:面向高超声速热防护系统工程中LLM分析计算能力的基准测试与诊断评估框架
人工智能
2026-04-21 v1
摘要
将大语言模型(LLM)作为安全关键航空航天工程中的推理助手需要更严格的评估标准,而非泛科学基准。在高超声速热防护系统(TPS)设计中, inaccurate stagnation-point heat flux 或边界层计算可能导致设计裕度违规。具有合理数值但物理无效答案的模型比拒绝响应的模型更危险。当前科学基准仅测试抽象数学和基础物理,仅评估最终答案,忽略工程推理过程,无法检测此类关键失效。我们提出TPS-CalcBench——首个针对高超声速气动学和高温气体动力学中闭形式解析计算的诊断基准,由经验丰富的TPS工程师完成。我们的贡献包括:领域导向的任务分类体系(包含4个难度等级和8个类别),基于Anderson教科书的构成;双轨评估测度结果准确性和推理质量,通过8维评分表和带人工审计的校准评委识别正确答案错误推理问题;人机数据管道生产420个高置信度核心项目和810个控制噪声的预筛选项目,来自4560个原始数据;噪声敏感性分析衡量数据质量对模型排名的影响;三种诊断干预方法:DFA-TPS微调、RAG-EQ检索 grounding 和 PA-CoT process-aware prompting。13个来自7组模型的测试显示显著性能差异(KPI 12.6-87.9),隐藏公式选择缺陷、数据驱动的排名变更和有效干预提升,建立了完整的诊断-评估-干预框架,用于安全关键工程LLM部署评估。
引用
@article{arxiv.2604.17966,
title = {TPS-CalcBench: A Benchmark and Diagnostic Evaluation Framework for LLM Analytical Calculation Competence in Hypersonic Thermal Protection System Engineering},
author = {Jinglai Zheng and Chuhan Qiao and Haiming Huang},
journal= {arXiv preprint arXiv:2604.17966},
year = {2026}
}