PentestJudge:依据操作需求评判智能体行为
人工智能
2025-08-06 v1 密码学与安全
摘要
我们引入了 PentestJudge,一个用于评估渗透测试智能体操作的系统。PentestJudge 是一个作为评判者的大型语言模型(LLM-as-judge),它可访问工具,使其能够处理智能体状态和工具调用历史的任意轨迹,以确定安全智能体的行为是否满足某些操作标准,而这些标准通过编程方式评估是不切实际的。我们开发了评分准则,使用树结构将特定环境下的渗透测试任务分层分解为更小、更简单且更易于管理的子任务和标准,直到每个叶节点代表 PentestJudge 评估的简单是或否标准。任务节点被分解为与操作目标、操作安全和业务技能相关的不同类别。作为评判者的 LLM 评分与人类领域专家进行了比较作为真实参考,使我们能够使用标准的二元分类指标(如 F1 分数)比较它们的相对表现。我们评估了几个前沿和开源模型作为评判智能体,最佳模型的 F1 分数达到 0.83。我们发现,更擅长使用工具的模型表现更接近人类专家。通过按需求类型对 F1 分数进行分层,我们发现即使是总分相似的模型在不同类型的问题上也会遇到困难,这表明某些模型可能更适合评判特定的操作标准。我们发现,较弱且较便宜的模型可以评判由更强且更昂贵的模型执行的渗透测试轨迹,这表明对于渗透测试任务,验证可能比生成更容易。我们分享此方法以促进未来的研究,理解评判者全面且可扩展地评估基于 AI 的信息安全智能体过程质量的能力,以便它们可以放心地用于敏感的生产环境中。
引用
@article{arxiv.2508.02921,
title = {PentestJudge: Judging Agent Behavior Against Operational Requirements},
author = {Shane Caldwell and Max Harley and Michael Kouremetis and Vincent Abruzzo and Will Pearce},
journal= {arXiv preprint arXiv:2508.02921},
year = {2025}
}
备注
18 pages, 5 figures, 3 tables