DiagnosticIQ:基于符号规则的 LLM 工业维护行动推荐基准
人工智能
2026-05-12 v1
摘要
监控复杂工业资产依赖由工程师编写的符号规则——这些规则基于传感器条件触发,提示技术员执行纠正措施。瓶颈在于响应:将规则转化为维护步骤需依赖通过实践积累的资产专属知识。我们调查 LLM 是否可作为规则到行动步骤的决策支持工具,引入 \ours{},来自 118 组规则-行动配对、覆盖 16 种资产类型的 6,690 条经专家验证的多选题基准。我们贡献 (i) 将符号规则规范化为析取范式 (DNF) 的符号到多选题 (MCQA) 流水线,配合嵌入式干扰项抽样;(ii) 五种探针不同失效模式的变体 (Pro、Pert、Verbose、Aug、Rationale);(iii) 29 个 LLM 和 4 个嵌入基线的基准。人类评估(9 位实践者,平均 45.0%)确认 \ours{} 超出常规操作经验需专家知识。三个发现尤为突出:前沿已闭合:最顶级三款 LLM 在 Macro 分辨率相差一点,Bradley-Terry Elo 将 claude-opus-4-6 位列第 30 分;\ours{},Pro 揭示脆弱性,所有模型在干扰项扩张下均损失 13-60% 相对准确率;\ours{},Aug 揭示模式匹配:在条件反转情境下,前沿模型仍以 49-63% 的比例选取原答案。部署瓶颈不在能力,而在校准:前沿模型能处理模板化故障检测,但在结构性扰动下便崩溃。
引用
@article{arxiv.2605.08614,
title = {DiagnosticIQ: A Benchmark for LLM-Based Industrial Maintenance Action Recommendation from Symbolic Rules},
author = {Devin Yasith De Silva and Dhaval Patel and Christodoulos Constantinides and Shuxin Lin and Nianjun Zhou and Paul J Adams and Sal Rosato and Nicolas Constantinides and Deborah L. McGuinness and Jayant Kalagnanam},
journal= {arXiv preprint arXiv:2605.08614},
year = {2026}
}
备注
43 pages, 25 figures