大型语言模型提示注入攻击的早期分类
密码学与安全
2024-02-05 v1 计算与语言
机器学习
摘要
大型语言模型和AI聊天机器人一直处于人工智能民主化的前沿。然而,ChatGPT及其他类似工具的发布引发了人们对控制大型语言模型及其输出难度的日益担忧。目前,我们正目睹一场猫鼠游戏:用户试图通过一种名为提示注入的新型攻击来滥用模型,而开发者则试图同时发现漏洞并阻止攻击。本文概述了这些新兴威胁,并提出了提示注入的分类,这可以指导未来关于提示注入的研究,并作为开发LLM接口时漏洞检查清单。此外,基于先前文献和我们自己的实证研究,我们讨论了提示注入对LLM最终用户、开发人员和研究人员的影响。
引用
@article{arxiv.2402.00898,
title = {An Early Categorization of Prompt Injection Attacks on Large Language Models},
author = {Sippo Rossi and Alisia Marianne Michel and Raghava Rao Mukkamala and Jason Bennett Thatcher},
journal= {arXiv preprint arXiv:2402.00898},
year = {2024}
}
备注
21 pages double spacing