中文

STAR-Teaming:基于策略-响应多网络方法的自动 LLM 红队测试

计算与语言 2026-04-22 v1

摘要

虽然大型语言模型 (LLM) 在各方面都得到广泛应用,但它们仍然容易受到能引发有害或不当响应的越狱提示词的攻击。本文引入 STAR-Teaming,一种新的黑盒框架,用于自动化红队测试,以有效生成此类攻击提示。STAR-Teaming 将多智能体系统 (MAS) 集成到策略-响应多网络中,并采用网络驱动的优化来采样有效的攻击策略。这种基于网络的方法将难以处理的高维嵌入空间重新构建为可处理的结构,从而带来两个关键优势:它增强了对 LLM 战略脆弱性的可解释性,并通过将搜索空间组织为语义社区来简化有效策略的搜索,从而防止冗余探索。实证结果表明,STAR-Teaming 在攻击成功率 (ASR) 上显著超越现有方法,同时计算成本更低。广泛的实验验证了多网络的有效性和可解释性。代码已公开于 https://github.com/selectstar-ai/STAR-Teaming-paper。

关键词

引用

@article{arxiv.2604.18976,
  title  = {STAR-Teaming: A Strategy-Response Multiplex Network Approach to Automated LLM Red Teaming},
  author = {MinJae Jung and YongTaek Lim and Chaeyun Kim and Junghwan Kim and Kihyun Kim and Minwoo Kim},
  journal= {arXiv preprint arXiv:2604.18976},
  year   = {2026}
}

备注

Accepted at ACL 2026 Findings