ACSE-Eval:LLM是否能够 threat model 现实世界云基础设施?
密码学与安全
2025-05-27 v2 人工智能
摘要
虽然大型语言模型在网络安全应用中显示出色,但其在识别云端部署中安全威胁的能力尚未探讨。本文引入AWS Cloud Security Engineering Eval(ACSE-Eval),用于评估LLM云安全威胁建模能力的新型数据集。ACSE-Eval包含100个生产级AWS部署场景,每个场景均包含详细的架构规格、基础设施即代码实现、记录的安全漏洞及关联威胁建模参数。我们的数据集 enables 对LLM识别安全风险、分析攻击向量并提出缓解策略在云环境中的能力进行系统性评估。我们的评估在ACSE-Eval上表明,GPT 4.1和Gemini 2.5 Pro在威胁识别方面表现突出,其中Gemini 2.5 Pro在0-shot场景中表现最佳,而GPT 4.1在few-shot设置中显示出优异结果。尽管GPT 4.1保持略微的整体性能优势,但Claude 3.7 Sonnet生成的威胁模型最具语义 sophistication(语义 sophistication),但在威胁分类与泛化方面存在挑战。为促进可重复性并推动自动化网络安全威胁分析领域的研究,我们开源了数据集、评估指标及方法论。
引用
@article{arxiv.2505.11565,
title = {ACSE-Eval: Can LLMs threat model real-world cloud infrastructure?},
author = {Sarthak Munshi and Swapnil Pathak and Sonam Ghatode and Thenuga Priyadarshini and Dhivya Chandramouleeswaran and Ashutosh Rana},
journal= {arXiv preprint arXiv:2505.11565},
year = {2025}
}
备注
Submitted to the 39th Annual Conference on Neural Information Processing Systems