PHMForge:通过MCP原生、算法驱动工具评估LLM代理在工业预测中的应用
人工智能
2026-05-12 v2
摘要
LLM代理开始通过模型上下文协议调用工业资产管理工具,但它们能否在此基础上可靠地执行安全关键的预测与健康管理任务仍是一个未解问题。先前的基准测试混淆了协议流利度与推理能力、仪器故障与代理故障以及工具使用与工具检索。我们引入了PHMForge,一个消除每种混淆的评估环境。PHMForge提供了99个由领域专家编写的场景,涵盖八类工业资产,包括旋转设备、航空发动机和锂离子电池,数据集包括NASA PCoE,通过39个MCP原生工具提供,这些工具封装了已发表的预测与健康管理算法(C-MAPSS、ISO 10816、Arrhenius容量衰减模型、时序基础模型)。在30个场景的分层旋转设备/航空发动机样本上,Krippendorff's α ∈ [0.74, 0.82];电池扩展为单评分者。在三个代理框架和六个LLM骨干网络的最强配置下,达到了80.8%的pass@1,剩余差距集中在编排和工具排序错误上。关键的是,架构消融实验表明,将MCP执行替换为基于文本的检索增强生成会导致电池类别的剩余使用寿命pass-all-3从100%骤降至20%(5/5对比1/5),暴露了静态检索用于预测计算的结构性局限。轨迹分解显示编排错误在各骨干网络中主导失败,而模式无效的工具调用集中在较小的开源模型中。前沿LLM在调用工具方面更强,但在规划何时调用方面较弱。PHMForge以确定性评估器、公共排行榜和数据手册的形式开源发布。
引用
@article{arxiv.2604.01532,
title = {PHMForge: Evaluating LLM Agents on Industrial Prognostics through MCP-Native, Algorithm-Grounded Tools},
author = {Tianjun Feng and Yunfeng Chen and Chun-Yi Tsai and Yihan Sun and Ayan Das and Kaoutar El Maghraoui and Shuxin Lin and Dhaval Patel},
journal= {arXiv preprint arXiv:2604.01532},
year = {2026}
}
备注
23 pages, 3 figures