ADVERSA:衡量大语言模型中多轮警戒线退化与裁判可靠性
机器学习
2026-05-25 v2 人工智能
摘要
大多数针对大语言模型(LLM)安全的对抗评估仅评估单个提示并报告二元通过/失败结果,无法捕捉安全属性在持续对抗互动下的演化情况。我们提出ADVERSA,一个自动化红队测试框架,用于将警戒线退化动态测量为连续的每轮合规轨迹,而非离散的越狱事件。ADVERSA使用微调的70B攻击模型(ADVERSA-Red,使用QLoRA对Llama-3.1-70B-Instruct进行微调),消除以往模型因安全拒绝而导致的攻击者不可靠问题。我们采用结构化的5分量表对受害者响应进行评分,将部分合规视为可度量的独立状态。我们报告了在三个前沿受害者模型(Claude Opus 4.6、Gemini 3.1 Pro、GPT-5.2)上的受控实验,使用三裁判共识架构,将裁判可靠性作为一级研究结果而非假设。我们观察到在15次最多10轮对话中,达成26.7%的越狱率,平均越狱轮次为1.25,表明在本评估设置下,成功的越狱集中发生在早期轮次,而非通过持续压力积累。我们记录了裁判间的一致性率、裁判自评倾向、攻击者在训练分布外部署时的漂移作为一种失败模式,以及攻击者拒绝作为一种此前未被报道的受害者抵抗力度量的混淆因素。我们明确说明了所有局限性。按照负责任披露政策,攻击提示被隐去;除此之外,所有实验制品均已公开。
引用
@article{arxiv.2603.10067,
title = {HTMuon: Improving Muon via Heavy-Tailed Spectral Correction},
author = {Tianyu Pang and Yujie Fang and Zihang Liu and Shenyang Deng and Lei Hsiung and Shuhua Yu and Yaoqing Yang},
journal= {arXiv preprint arXiv:2603.10067},
year = {2026}
}