RedCoder:代码 LLM 的自动多轮红队测试
软件工程
2025-07-31 v1 人工智能
摘要
针对代码生成的大型语言模型(Code LLM)已展现出在 AI 辅助软件开发和测试方面的显著能力。然而,近期研究表明,这些模型在对抗性情境下容易生成漏洞或恶意代码。现有的红队测试方法依赖大量人力工作,限制了其可扩展性和实际应用,通常忽视了现实 AI 辅助编程的交互性,这种情境通常在多个回合中展开。为弥合这一差距,我们提出了 RedCoder,一种能够在多轮对话中与受害模型交互,以诱导漏洞代码的红队智能体。构建 RedCoder 的管道从多智能体游戏过程开始,模拟对抗性交互,产生一套原型对话和一套可重复使用的攻击策略集合。我们随后在这些原型对话上微调 LLM,用作 RedCoder 的核心。一旦部署,RedCoder 将自主地与 Code LLM 进行多轮对话,动态检索相关策略以引导对话走向产生漏洞的输出。跨多个 Code LLM 的实验表明,我们的方法在诱导代码生成中的漏洞方面超过先前的单轮和多轮红队方法,为评估现代代码生成系统的安全边界提供了可扩展且高效的工具。
引用
@article{arxiv.2507.22063,
title = {RedCoder: Automated Multi-Turn Red Teaming for Code LLMs},
author = {Wenjie Jacky Mo and Qin Liu and Xiaofei Wen and Dongwon Jung and Hadi Askari and Wenxuan Zhou and Zhe Zhao and Muhao Chen},
journal= {arXiv preprint arXiv:2507.22063},
year = {2025}
}