中文

RvB:通过迭代红蓝博弈实现AI系统加固自动化

密码学与安全 2026-01-28 v1 人工智能 计算与语言

摘要

大型语言模型(LLM)的双重攻防效用凸显了AI安全中的一个关键缺口:缺乏用于动态、迭代式对抗自适应加固的统一框架。为弥补这一缺口,我们提出了红队与蓝队(RvB)框架,将其形式化为一种免训练、序贯、不完全信息博弈。在此过程中,红队暴露漏洞,驱动蓝队在无需参数更新的情况下学习有效解决方案。我们在两个具有挑战性的领域验证了该框架:针对CVE的动态代码加固和针对越狱攻击的护栏优化。我们的实证结果表明,这种交互迫使蓝队学习基本的防御原则,从而产生稳健的修复措施,而不仅仅是过度拟合特定漏洞。RvB在各自任务上实现了90%和45%的防御成功率,同时保持接近0%的误报率,显著超越了基线。这项工作确立了迭代对抗交互框架作为一种实用范式,能够自动化地持续加固AI系统。

关键词

引用

@article{arxiv.2601.19726,
  title  = {RvB: Automating AI System Hardening via Iterative Red-Blue Games},
  author = {Lige Huang and Zicheng Liu and Jie Zhang and Lewen Yan and Dongrui Liu and Jing Shao},
  journal= {arXiv preprint arXiv:2601.19726},
  year   = {2026}
}