捕获旗帜:基于语义保持转换的智能体 LLM 家庭评估
软件工程
2026-04-20 v2 人工智能
摘要
智能体大语言模型(LLM)正在通过捕获旗帜(CTF)基准进行网络安全任务评估,但现有的点评基准对智能体鲁棒性和在源代码不同版本之间的泛化能力提供的见解有限。我们引入 CTF 挑战家庭,通过语义等价转换从单个 CTF 生成一系列挑战,实现受控评估鲁棒性,同时保持底层 exploit 策略不变。我们提出了 Evolve-CTF,一个从 Python 挑战中生成 CTF 家庭的工具,采用多种转换。使用 Evolve-CTF 从 Cybench 和 Intercode 挑战中派生出家庭后,我们对 13 种具备工具访问的智能体 LLM 配置进行评估。我们发现模型对重命名和代码插入具有惊人的鲁棒性,但组合转换和更深层的混淆会因需要更复杂的工具使用而导致性能下降。启用显式推理对成功率几乎没有影响。我们的工作为未来的 LLM 评估提供了一种技术和工具,并描绘了当前最先进模型在该领域能力的大型数据集。
引用
@article{arxiv.2602.05523,
title = {Capture the Flags: Family-Based Evaluation of Agentic LLMs via Semantics-Preserving Transformations},
author = {Shahin Honarvar and Amber Gorzynski and James Lee-Jones and Harry Coppock and Marek Rei and Joseph Ryan and Alastair F. Donaldson},
journal= {arXiv preprint arXiv:2602.05523},
year = {2026}
}