GenTel-Safe:用于防御提示注入攻击的统一基准与防护框架
密码学与安全
2024-10-01 v1 机器学习
摘要
像GPT-4、LLaMA和Qwen这样的大型语言模型(LLMs)在广泛的应用中已展现出显著的成功。然而,这些模型仍然容易受到提示注入攻击,这种攻击可以绕过现有的安全机制,凸显了对更强大的攻击检测方法和全面评估基准的迫切需求。为了应对这些挑战,我们引入了GenTel-Safe,一个统一框架,包括一种新颖的提示注入攻击检测方法GenTel-Shield,以及一个全面的评估基准GenTel-Bench,该基准包含84812个提示注入攻击,涵盖3个主要类别和28个安全场景。为了证明GenTel-Shield的有效性,我们将其与普通的防护栏一起在GenTel-Bench数据集上进行了评估。经验上,GenTel-Shield能够达到最先进的攻击检测成功率,这揭示了现有防护技术在面对有害提示时的关键弱点。为了可复现性,我们已在项目页面https://gentellab.github.io/gentel-safe.github.io/上提供了代码和基准数据集。
引用
@article{arxiv.2409.19521,
title = {GenTel-Safe: A Unified Benchmark and Shielding Framework for Defending Against Prompt Injection Attacks},
author = {Rongchang Li and Minjie Chen and Chang Hu and Han Chen and Wenpeng Xing and Meng Han},
journal= {arXiv preprint arXiv:2409.19521},
year = {2024}
}