Tensor Trust:来自在线游戏的可解释提示注入攻击
机器学习
2023-11-03 v1 密码学与安全
摘要
尽管大型语言模型(LLMs)正日益被用于真实世界应用,它们仍易受提示注入攻击:恶意第三方提示颠覆系统设计者的意图。为帮助研究者研究此问题,我们呈现一个包含超过 126,000 条提示注入攻击与 46,000 条针对提示注入的基于提示的“防御”的数据集,全部由一款名为 Tensor Trust 的在线游戏的玩家创建。据我们所知,这是当前最大的用于指令遵循 LLM 的人类生成对抗样本数据集。我们数据集中的攻击具有大量易于解释的结构,并揭示了 LLM 的弱点。我们也使用该数据集创建了一个针对两类提示注入的抵抗基准,我们称之为提示提取与提示劫持。我们的基准结果表明许多模型易受 Tensor Trust 数据集中的攻击策略影响。此外,我们表明数据集中的某些攻击策略可泛化至已部署的基于 LLM 的应用,尽管它们与游戏有着非常不同的约束集。我们在 https://tensortrust.ai/paper 发布所有数据与源代码。
引用
@article{arxiv.2311.01011,
title = {Tensor Trust: Interpretable Prompt Injection Attacks from an Online Game},
author = {Sam Toyer and Olivia Watkins and Ethan Adrian Mendes and Justin Svegliato and Luke Bailey and Tiffany Wang and Isaac Ong and Karim Elmaaroufi and Pieter Abbeel and Trevor Darrell and Alan Ritter and Stuart Russell},
journal= {arXiv preprint arXiv:2311.01011},
year = {2023}
}