FRACTURED-SORRY-Bench:揭示削弱拒绝效能与防御的对话式攻击框架
计算与语言
2024-11-08 v2 人工智能
摘要
本文介绍 FRACTURED-SORRY-Bench,这是一个用于评估大型语言模型(LLM)在多轮对话攻击下的安全性的框架。基于 SORRY-Bench 数据集,我们提出一种简单而有效的方法,通过将有害查询分解为看似无害的子问题来生成对抗性提示。我们的方法在 GPT-4、GPT-4o、GPT-4o-mini 和 GPT-3.5-Turbo 模型上实现了最高提升了 +46.22% 的攻击成功率(ASR),相对于基线方法。我们展示了这一技术对当前 LLM 安全措施构成挑战,并强调需要更稳健的防御以应对细微的多轮攻击。
引用
@article{arxiv.2408.16163,
title = {FRACTURED-SORRY-Bench: Framework for Revealing Attacks in Conversational Turns Undermining Refusal Efficacy and Defenses over SORRY-Bench (Automated Multi-shot Jailbreaks)},
author = {Aman Priyanshu and Supriti Vijay},
journal= {arXiv preprint arXiv:2408.16163},
year = {2024}
}
备注
4 pages, 2 tables