FailureSensorIQ:用于理解传感器关系和故障模式的多选 QA 数据集
计算与语言
2025-06-05 v1
摘要
我们介绍 FailureSensorIQ,一个新的多选问答 (Multi-Choice Question-Answering, MCQA) 基准系统,旨在评估大型语言模型 (Large Language Model, LLM) 理解 Industry 4.0 环境中复杂、领域特定情景的能力。与传统 QA 基准不同,本系统聚焦于通过故障模式、传感器数据及其之间的关系来进行多层次推理,这些关系跨越各种工业资产。通过本工作,我们设想一种范式转变,建模决策不仅仅是利用相关性分析和显著性检验等统计工具从数据中驱动,还能由能够推理关于关键贡献者和可由特征工程捕获的有用模式的专业化 LLM 从领域驱动。我们评估了超过十几种 LLM(包括 GPT-4、Llama 和 Mistral)在 FailureSensorIQ 上的表现, 从不同视角进行评估,包括扰动-不确定性-复杂度分析、专家评估研究、资产特定知识缺口分析、使用外部知识库的 ReAct 代理。尽管具有强大推理能力的闭源模型接近专家水平,但综合基准结果显示其性能出现显著下降, 对扰动、干扰以及模型内在知识缺口极其脆弱。我们还提供了一个实际案例研究,展示 LLM 如何在与各种资产相关的三个故障预测数据集上驱动建模决策。我们发布:(a) 面向各种工业资产的专家精选 MCQA,(b) 基于来自 ISO 文档中非文本数据的 FailureSensorIQ 基准和 Hugging Face 排行榜,以及 (c) 基于 LLM 的特征选择 scikit-learn 管道 LLMFeatureSelector。该软件可在 https://github.com/IBM/FailureSensorIQ 提供。
引用
@article{arxiv.2506.03278,
title = {FailureSensorIQ: A Multi-Choice QA Dataset for Understanding Sensor Relationships and Failure Modes},
author = {Christodoulos Constantinides and Dhaval Patel and Shuxin Lin and Claudio Guerrero and Sunil Dagajirao Patil and Jayant Kalagnanam},
journal= {arXiv preprint arXiv:2506.03278},
year = {2025}
}