中文

ASTPrompter:基于对比偏好学习的自动化语言模型红队测试生成低困惑度不安全提示

计算与语言 2025-09-24 v6

摘要

现有的 LLM 红队测试方法侧重于提高攻击成功率,往往导致生成高困惑度的提示。这种做法忽略了低困惑度攻击的潜在风险,这类攻击更难以过滤,更可能在正常使用场景中出现,且对后续训练产生的负面影响更大。为此,我们提出 ASTPrompter,这是一种单步优化方法,利用对比偏好学习训练攻击者,在实现高攻击成功率 (ASR) 的同时维持低困惑度。ASTPrompter 在 Llama-8.1B 上的攻击成功率提升 5.1 倍,且生成的输入根据冻结 LLM 的概率发生 2.1 倍的增加。此外,我们的攻击方法在 Mistral-7B、Qwen-7B 和 TinyLlama 上在黑盒和白盒设置下均能有效迁移。最后,通过调整方法中的单个超参数,我们发现沿着 ASR 与困惑度有效前沿的成功攻击前缀,这凸显了困惑度在红队测试中的这一此前被忽视的因素。

关键词

引用

@article{arxiv.2407.09447,
  title  = {ASTPrompter: Preference-Aligned Automated Language Model Red-Teaming to Generate Low-Perplexity Unsafe Prompts},
  author = {Amelia F. Hardy and Houjun Liu and Allie Griffith and Bernard Lange and Duncan Eddy and Mykel J. Kochenderfer},
  journal= {arXiv preprint arXiv:2407.09447},
  year   = {2025}
}

备注

8 pages, 7 pages of appendix, 3 tables, 4 figures