中文

FRACTURED-SORRY-Bench:揭示削弱拒绝效能与防御的对话式攻击框架

计算与语言 2024-11-08 v2 人工智能

摘要

本文介绍 FRACTURED-SORRY-Bench,这是一个用于评估大型语言模型(LLM)在多轮对话攻击下的安全性的框架。基于 SORRY-Bench 数据集,我们提出一种简单而有效的方法,通过将有害查询分解为看似无害的子问题来生成对抗性提示。我们的方法在 GPT-4、GPT-4o、GPT-4o-mini 和 GPT-3.5-Turbo 模型上实现了最高提升了 +46.22% 的攻击成功率(ASR),相对于基线方法。我们展示了这一技术对当前 LLM 安全措施构成挑战,并强调需要更稳健的防御以应对细微的多轮攻击。

关键词

引用

@article{arxiv.2408.16163,
  title  = {FRACTURED-SORRY-Bench: Framework for Revealing Attacks in Conversational Turns Undermining Refusal Efficacy and Defenses over SORRY-Bench (Automated Multi-shot Jailbreaks)},
  author = {Aman Priyanshu and Supriti Vijay},
  journal= {arXiv preprint arXiv:2408.16163},
  year   = {2024}
}

备注

4 pages, 2 tables