中文

通过序列熵变化检测基于优化的流畅对抗提示

机器学习 2026-05-20 v1 人工智能

摘要

基于优化的对抗后缀可以越狱对齐的大语言模型(LLM),同时保持流畅性,削弱了基于静态和窗口化困惑度的检测器。我们将对抗后缀检测建模为在词元级下一词元熵流上的在线变点检测问题。利用LLM系统提示估计稳健基线,我们对用户词元熵进行标准化,并应用单侧CUSUM统计量。由此产生的检测器CPD Online (CPD)与模型无关、无需训练、在线运行,并能定位对抗后缀的起始位置。在包含1012个基于优化的后缀攻击(GCG、AutoDAN、AdvPrompter、BEAST、AutoDAN-HGA)和1012个困惑度受控的良性提示的基准测试中,CPD在所有六个开源权重聊天模型(LLaMA-2-7B/13B、Vicuna-7B/13B、Qwen2.5-7B/14B)上的F1分数均优于最强的窗口化困惑度基线。在LLaMA-2-7B上,使用标准CUSUM设置(k=0k=0),CPD达到AUROC 0.880.88和F1 0.820.82。除了提示级检测,CPD将其79.6%的触发集中在对抗后缀内部,而窗口化困惑度仅为17-46%。最后,当用作LLaMA Guard的轻量级门控时,CPD在良性主导的高容量部署中减少了17-22%的守卫调用,同时保持了守卫级检测质量。

关键词

引用

@article{arxiv.2605.19966,
  title  = {Detecting Fluent Optimization-Based Adversarial Prompts via Sequential Entropy Changes},
  author = {Mohammed Alshaalan and Miguel R. D. Rodrigues},
  journal= {arXiv preprint arXiv:2605.19966},
  year   = {2026}
}

备注

Accepted at ICML 2026; 20 pages, including 9 pages main text, references, and appendix