FactoryBench:评估工业机器理解的基准
人工智能
2026-05-11 v1 机器学习
摘要
我们介绍 FactoryBench,这是一个用于评估时间序列模型和 LLM 在工业机器人遥测数据上的机器理解能力的基准测试。Q&A 对沿用四个因果层次(状态、干预、反事实、决策)组织,实例化珠海的梯阶,涵盖五种答案格式:四种结构化格式按确定性计分,自由格式答案通过 LLM 作为仲裁的投票协议计分。我们提出了一个围绕结构化问题模板构建的可扩展 Q&A 生成框架,展示 FactoryWave(一个来自 UR3 机械臂和 KUKA KR10 工业臂的稠密、多任务、多变量传感器数据集),并构建 FactoryBench 作为超过 70k 项 Q&A 项目,基于约 15k 个标准化剧集,来自 FactoryWave、AURSAD 和 voraus-AD,配有 14 个检索、规划和 LLM 基线,以及 25 个指标,组织在准确性、 grounding 和恢复三个维度下。对六个前沿 LLM 的零样本评估显示,没有模型在结构化层次上超过 50% 或在决策-making 上超过 18%,揭示了当前模型与实际运行机器理解之间存在广泛差距。
引用
@article{arxiv.2605.07675,
title = {FactoryBench: Evaluating Industrial Machine Understanding},
author = {Yanis Merzouki and Coral Izquierdo and Matei Ignuta-Ciuncanu and Marcos Gomez-Bracamonte and Riccardo Maggioni and Alessandro Lombardi and Camilla Mazzoleni and Federico Martelli and Balazs Gunther and Jonas Petersen and Philipp Petersen},
journal= {arXiv preprint arXiv:2605.07675},
year = {2026}
}
备注
9 pages, 4 figures, 14 tables; appendix with 24 pages