Maatphor:针对提示注入攻击的自动化变体分析
密码学与安全
2023-12-20 v1 人工智能
机器学习
摘要
提示注入已成为大型语言模型(LLM)面临的严重安全威胁。目前,防御新发现的提示注入技术的最佳实践是向系统添加额外的护栏(例如,通过更新系统提示或在模型的输入和/或输出上使用分类器)。然而,正如创建恶意软件变体以逃避防病毒软件一样,也可以创建提示注入的变体以逃避 LLM 的护栏。理想情况下,当发现新的提示注入技术时,候选防御不仅应针对成功的提示注入进行测试,还应针对可能的变体进行测试。在这项工作中,我们提出了一种工具,以协助防御者对已知的提示注入攻击执行自动化变体分析。这涉及解决两个主要挑战:(1)根据给定提示自动生成变体,以及(2)仅根据模型的输出自动确定变体是否有效。该工具还可以协助生成越狱和提示注入攻击的数据集,从而克服该领域数据稀缺的问题。我们在三种不同类型的提示注入任务上评估了 Maatphor。从一个无效(0%)的种子提示开始,Maatphor 在前 40 次迭代中持续生成有效率至少为 60% 的变体。
引用
@article{arxiv.2312.11513,
title = {Maatphor: Automated Variant Analysis for Prompt Injection Attacks},
author = {Ahmed Salem and Andrew Paverd and Boris Köpf},
journal= {arXiv preprint arXiv:2312.11513},
year = {2023}
}