BlueCodeAgent:一种由自动化红队测试驱动的用于代码生成AI的蓝队智能体
软件工程
2025-10-22 v1
摘要
随着大型语言模型(LLM)越来越多地用于代码生成,对安全风险的担忧已大幅增长。早期研究主要集中在红队测试上,旨在揭示和评估代码生成模型的漏洞和风险。然而,蓝队测试方面的进展仍然有限,因为开发防御需要有效的语义理解来区分不安全与安全。为填补这一空白,我们提出了BlueCodeAgent,一种由自动化红队测试驱动的端到端蓝队智能体。我们的框架整合了双方:红队测试生成多样化的风险实例,而蓝队智能体则利用这些实例,通过宪法和代码分析以及智能体集成进行多级防御,来检测已见和未见过的风险场景。我们在三个代表性的代码相关任务——偏见指令检测、恶意指令检测和漏洞代码检测——上的评估表明,BlueCodeAgent相对于基础模型和基于安全提示的防御取得了显著提升。特别是在漏洞代码检测任务中,BlueCodeAgent集成了动态分析以有效减少误报,这是一个具有挑战性的问题,因为基础模型往往过于保守,将安全代码误分类为不安全。总体而言,BlueCodeAgent在三个任务的四个数据集上平均F1分数提升了12.7%,这归功于其总结可操作宪法以增强上下文感知风险检测的能力。我们证明,红队测试通过持续识别新漏洞来增强防御性能,从而有益于蓝队测试。
引用
@article{arxiv.2510.18131,
title = {BlueCodeAgent: A Blue Teaming Agent Enabled by Automated Red Teaming for CodeGen AI},
author = {Chengquan Guo and Yuzhou Nie and Chulin Xie and Zinan Lin and Wenbo Guo and Bo Li},
journal= {arXiv preprint arXiv:2510.18131},
year = {2025}
}