评估多智能体 AI 系统安全运营能力的基准构建设计原则
密码学与安全
2026-04-01 v1 人工智能
摘要
随着大语言模型(LLMs)和多智能体 AI 系统在网络安全运营中展现出日益增长的潜力,组织、政策制定者、模型提供商以及 AI 和网络安全领域的研究人员希望量化此类 AI 系统的能力,以实现更自主的安全运营中心(SOC)并减少人工劳动。特别是,AI 和网络安全社区最近开发了多个用于评估多智能体 AI 系统红队能力的基准。然而,由于 SOC 中的运营以蓝队运营为主,若没有一个专注于蓝队运营的基准,就无法评估 AI 系统和智能体实现更自主 SOC 的能力。据我们所知,文献中尚未提出用于评估协调多任务蓝队 AI 的系统性基准。现有的蓝队基准聚焦于特定任务。本研究的目标是开发一套用于构建基准的设计原则,该基准记为 SOC-bench,用于评估 AI 的蓝队能力。遵循这些设计原则,我们开发了 SOC-bench 的概念设计,它由五个蓝队任务组成,背景是大规模勒索软件攻击事件响应。
引用
@article{arxiv.2603.28998,
title = {Design Principles for the Construction of a Benchmark Evaluating Security Operation Capabilities of Multi-agent AI Systems},
author = {Yicheng Cai and Mitchell John DeStefano and Guodong Dong and Pulkit Handa and Peng Liu and Tejas Singhal and Peiyu Tseng and Winston Jen White},
journal= {arXiv preprint arXiv:2603.28998},
year = {2026}
}
备注
29 pages, 1 figure