中文

CritBench:评估大型语言模型在IEC 61850数字继电器环境下网络安全能力的框架

密码学与安全 2026-04-08 v1 人工智能

摘要

大型语言模型(LLM)的不断发展引发了其在网络安全领域的双刃剑潜力。现有评估框架几乎全部聚焦于信息技术(IT)环境,无法捕捉运营技术(OT)的约束条件和专用协议。为填补这一差距,我们介绍CritBench——一个用于评估大型语言模型代理在IEC 61850数字继电器环境下网络安全能力的新型框架。我们评估了包括OpenAI的GPT-5系列在内的五种最先进模型,涵盖81个领域特定任务,包括静态配置分析、网络流量侦察和虚拟机交互。为促进工业协议交互,我们开发了领域特定工具框架。我们的实证结果表明,代理可靠地执行静态结构文件分析和单工具网络枚举,但在动态任务上的表现下降。尽管模型展现出对IEC 61850标准术语的显性、内化知识,但当前模型在操控 live 系统时难以实现持续的顺序推理和状态跟踪,除非配合专用工具。赋予代理我们的领域特定工具框架可显著缓解这一运营瓶颈。代码和评估脚本已提供:https://github.com/GKeppler/CritBench

关键词

引用

@article{arxiv.2604.06019,
  title  = {CritBench: A Framework for Evaluating Cybersecurity Capabilities of Large Language Models in IEC 61850 Digital Substation Environments},
  author = {Gustav Keppler and Moritz Gstür and Veit Hagenmeyer},
  journal= {arXiv preprint arXiv:2604.06019},
  year   = {2026}
}

备注

16 pages, 4 figures, 3 tables. Submitted to the 3rd ACM SIGEnergy Workshop on Cybersecurity and Privacy of Energy Systems (ACM EnergySP '26)