Reflect-Guard:通过逻辑自反提升 LLM 安全对抗提示防御
密码学与安全
2026-05-26 v1 人工智能
摘要
大型语言模型(LLM)安全分类器如 Llama Guard 在检测公开有害提示方面有效,但仍对能够通过角色扮演场景、虚构框架和间接请求掩饰恶意意图的对抗性 jailbreak 攻击保持脆弱。我们提出 Reflect-Guard,通过参数高效微调增强 LLM 安全分类器的链式思维自反思能力。我们的 метод 将 GPT-4o-mini 中的分析推理蒸馏为结构化反思标注,然后通过 QLoRA 在 Llama-Guard-3-8B 上训练生成安全裁决前的逻辑自反思。仅使用 1000 个训练样例并更新约 0.5% 的模型参数(约 4200 万),Reflect-Guard 在两个具有挑战性的基准上实现显著提升。WildGuardTest 上 F1 分数从 0.770 提升至 0.842(提升 7.2 百分点),对对抗提示的召回率从 0.513 提升至 0.921(提升 40.8 百分点)。JailbreakBench 上攻击成功率从 10.3% 降至 1.8%,实现约 82.5% 的相对降低。这些提升在对抗输入上尤为显著,显式推理步骤使模型能够看穿那些能击败标准模式匹配方法的混淆技术。我们的结果表明,教导安全分类器对对抗意图进行推理而非仅对表面模式进行分类,是提升 LLM 安全性的有前景的方向。
引用
@article{arxiv.2605.24834,
title = {Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection},
author = {Lixing Lin and Juli You and Yue Li and Luyun Lin and Yiqing Wang and Zhen Zhang and Moxuan Zheng},
journal= {arXiv preprint arXiv:2605.24834},
year = {2026}
}
备注
12 pages, 2 figures, and 4 tables