用于解决夺旗赛挑战的大语言模型测量与增强
人工智能
2025-06-24 v1
摘要
夺旗赛(CTF)竞赛对网络安全教育和培训至关重要。随着大语言模型的演进,人们对其自动化解决 CTF 挑战的能力越来越感兴趣。例如,DARPA 自 2023 年起组织了 AIxCC 竞赛,以推进 AI 驱动的自动化攻防。然而,这需要结合多种能力,从知识到推理,再到行动。在本文中,我们强调了技术知识在解决 CTF 问题中的重要性,并刻意构建了一个聚焦的基准 CTFKnow,包含 3,992 个问题,以衡量 LLM 在这一核心方面的表现。我们的研究为 LLM 理解 CTF 知识并将其应用于解决 CTF 挑战的能力提供了聚焦且创新的衡量。我们的主要发现表明,尽管 LLM 拥有丰富的技术知识,但它们在将这些知识准确应用于特定场景以及根据 CTF 环境的反馈调整策略方面存在困难。基于从该测量研究中获得的洞察,我们提出了 CTFAgent,一种用于推进 CTF 问题解决的 LLM 驱动的新颖框架。CTFAgent 引入了两个新模块:两阶段检索增强生成(RAG)和交互式环境增强,分别增强 LLM 在 CTF 上的技术知识和漏洞利用能力。我们的实验结果表明,在两个流行的 CTF 数据集上,CTFAgent 均实现了超过 80% 的性能提升。此外,在最近由 CMU 主办的 picoCTF2024 中,CTFAgent 在近 7,000 支参赛队伍中排名前 23.6%。这反映了我们测量研究的益处以及我们的框架在提升 LLM 解决 CTF 问题能力方面的潜力。
引用
@article{arxiv.2506.17644,
title = {Measuring and Augmenting Large Language Models for Solving Capture-the-Flag Challenges},
author = {Zimo Ji and Daoyuan Wu and Wenyuan Jiang and Pingchuan Ma and Zongjie Li and Shuai Wang},
journal= {arXiv preprint arXiv:2506.17644},
year = {2025}
}