中文

评估多智能体 AI 系统安全运营能力的基准构建设计原则

密码学与安全 2026-04-01 v1 人工智能

摘要

随着大语言模型(LLMs)和多智能体 AI 系统在网络安全运营中展现出日益增长的潜力,组织、政策制定者、模型提供商以及 AI 和网络安全领域的研究人员希望量化此类 AI 系统的能力,以实现更自主的安全运营中心(SOC)并减少人工劳动。特别是,AI 和网络安全社区最近开发了多个用于评估多智能体 AI 系统红队能力的基准。然而,由于 SOC 中的运营以蓝队运营为主,若没有一个专注于蓝队运营的基准,就无法评估 AI 系统和智能体实现更自主 SOC 的能力。据我们所知,文献中尚未提出用于评估协调多任务蓝队 AI 的系统性基准。现有的蓝队基准聚焦于特定任务。本研究的目标是开发一套用于构建基准的设计原则,该基准记为 SOC-bench,用于评估 AI 的蓝队能力。遵循这些设计原则,我们开发了 SOC-bench 的概念设计,它由五个蓝队任务组成,背景是大规模勒索软件攻击事件响应。

关键词

引用

@article{arxiv.2603.28998,
  title  = {Design Principles for the Construction of a Benchmark Evaluating Security Operation Capabilities of Multi-agent AI Systems},
  author = {Yicheng Cai and Mitchell John DeStefano and Guodong Dong and Pulkit Handa and Peng Liu and Tejas Singhal and Peiyu Tseng and Winston Jen White},
  journal= {arXiv preprint arXiv:2603.28998},
  year   = {2026}
}

备注

29 pages, 1 figure