Claudini:自主研究发现面向LLM的SOTA对抗攻击算法
机器学习
2026-03-26 v1 人工智能
密码学与安全
摘要
LLM代理如Claude Code不仅可以编写代码,还可用于自主AI研究与工程开发。我们展示了由Claude Code驱动的“自主研究”(autoresearch)流程发现新颖的白盒对抗攻击算法,这些算法在jailbreaking和prompt injection评估中显著优于所有现有(30+)方法。从现有攻击实现(如GCG)开始,该代理迭代产生新算法,在针对GPT-OSS-Safeguard-20B的CBRN查询上实现最高40%的攻击成功率,而现有算法的成功率不足10%。所发现的算法具有普适性:针对替代模型优化的攻击可直接转移到持留的模型上,针对Meta-SecAlign-70B实现100%的ASR,而最佳基线仅为56%。延续对\cite{carlini2025autoadvexbench}的研究,我们的结果是自动化使用LLM代理进行安全性和安全性研究的早期示例。白盒对抗红队测试特别适合此方法:现有方法提供强大的起点,而优化目标则提供密集的、定量的反馈。我们在https://github.com/romovpa/claudini发布所有发现的攻击及基线实现和评估代码。
引用
@article{arxiv.2603.24511,
title = {Claudini: Autoresearch Discovers State-of-the-Art Adversarial Attack Algorithms for LLMs},
author = {Alexander Panfilov and Peter Romov and Igor Shilov and Yves-Alexandre de Montjoye and Jonas Geiping and Maksym Andriushchenko},
journal= {arXiv preprint arXiv:2603.24511},
year = {2026}
}