IndustryBench:探索LLM在工业知识边界的表现
人工智能
2026-05-14 v3
摘要
在工业采购中,只有当LLM回答能通过标准检查时才有用:所推荐的材料必须匹配作业条件,每个参数都必须遵守监管阈值,且任何程序都不能违反安全条款。部分正确性可能会掩盖对安全关键矛盾的检测,而这类检测在LLM基准测试中往往未被充分捕获。我们引入IndustryBench,这是一个包含2,049个项目的工业采购问答基准测试,基于中国国家标准(GB/T)和结构化工业产品记录,按七个能力维度、十个行业类别和面板派生的难度层次组织,并提供与项目对齐的英文、俄文和越南文版本。我们的构建管道在基于搜索的外部验证阶段淘汰了70.3%的LLM生成候选方案,校准了LLM过滤后工业问答仍然不可靠的程度。我们的评估将原始正确性(由Qwen3-Max裁判评分,κ_w=0.798)与独立的安全违规(SV)检查分离。我们发现:(i)最佳系统仅得2.083分(满分3分),仍有显著提升空间;(ii)标准与术语是最持久的能力薄弱环节且在项目对齐翻译中仍存;(iii)扩展推理会降低12个模型中的13个模型的安全调整得分,主要是将不受支持的安全关键细节引入更长的最终答案中;(iv)安全违规率会重排排行榜——GPT-5.4在SV调整后从第6名提升至第3名,而Kimi-k2.5-1T-A32B则下降七名。工业LLM评估需要基于源文本的、安全感知的诊断,而非简单求平均准确率。我们发布IndustryBench,包含所有提示词、评分脚本和数据集文档。
引用
@article{arxiv.2605.10267,
title = {IndustryBench: Probing the Industrial Knowledge Boundaries of LLMs},
author = {Songlin Bai and Xintong Wang and Linlin Yu and Bin Chen and Zhiang Xu and Yuyang Sheng and Changtong Zan and Xiaofeng Zhu and Yizhe Zhang and Jiru Li and Mingze Guo and Ling Zou and Yalong Li and Chengfu Huo and Liang Ding},
journal= {arXiv preprint arXiv:2605.10267},
year = {2026}
}