忽略前述提示:面向语言模型的攻击技术
计算与语言
2022-11-18 v1 人工智能
摘要
基于Transformer的大型语言模型(LLMs)为大规模面向客户应用中的自然语言任务提供了强大基础。然而,探究其因恶意用户交互而产生漏洞的研究甚少。通过提出PromptInject——一个用于基于掩码迭代对抗提示组合的平实对齐框架,我们考察了部署最广泛的生产语言模型GPT-3如何能被简单的手工输入轻易地错对齐。特别地,我们研究两类攻击——目标劫持与提示泄露——并证明即便能力低下但意图足够的恶意代理,也能轻易利用GPT-3的随机性,制造长尾风险。PromptInject的代码见于 https://github.com/agencyenterprise/PromptInject。
引用
@article{arxiv.2211.09527,
title = {Ignore Previous Prompt: Attack Techniques For Language Models},
author = {Fábio Perez and Ian Ribeiro},
journal= {arXiv preprint arXiv:2211.09527},
year = {2022}
}
备注
ML Safety Workshop NeurIPS 2022