LLM 集成应用的提示提取基准:Raccoon
密码学与安全
2024-10-29 v2 计算与语言
摘要
随着 LLM 集成应用(如 GPT-s)的普及,数以百万计的模型已部署,提供通过专用指令提示实现的宝贵服务。然而,这些系统容易通过精心设计的查询受到提示提取攻击。为帮助缓解此问题,我们引入 Raccoon 基准,全面评估模型对提示提取攻击的易受性。我们新颖的评估方法在无防御和防御情景下评估模型,采用双重方法评估现有防御措施的有效性和模型的韧性。该基准涵盖 14 类提示提取攻击,包括额外的复合攻击,紧密模拟潜在攻击者的策略,以及多样化的防御模板。据我们了解,这是目前最为全面的提示盗窃攻击和防御机制集合。我们的发现表明,在无防御情况下,所有模型都普遍易受提示盗窃,而 OpenAI 模型在受保护时显示出显著的韧性。本文旨在建立更系统的基准来评估 LLM 对提示提取攻击的韧性,提供对其原因和潜在对策的见解。Raccoon 的资源已在 https://github.com/M0gician/RaccoonBench 上公开。
引用
@article{arxiv.2406.06737,
title = {Raccoon: Prompt Extraction Benchmark of LLM-Integrated Applications},
author = {Junlin Wang and Tianyi Yang and Roy Xie and Bhuwan Dhingra},
journal= {arXiv preprint arXiv:2406.06737},
year = {2024}
}
备注
ACL 2024 Findings