中文

忽略前述提示:面向语言模型的攻击技术

计算与语言 2022-11-18 v1 人工智能

摘要

基于Transformer的大型语言模型(LLMs)为大规模面向客户应用中的自然语言任务提供了强大基础。然而,探究其因恶意用户交互而产生漏洞的研究甚少。通过提出PromptInject——一个用于基于掩码迭代对抗提示组合的平实对齐框架,我们考察了部署最广泛的生产语言模型GPT-3如何能被简单的手工输入轻易地错对齐。特别地,我们研究两类攻击——目标劫持与提示泄露——并证明即便能力低下但意图足够的恶意代理,也能轻易利用GPT-3的随机性,制造长尾风险。PromptInject的代码见于 https://github.com/agencyenterprise/PromptInject。

关键词

引用

@article{arxiv.2211.09527,
  title  = {Ignore Previous Prompt: Attack Techniques For Language Models},
  author = {Fábio Perez and Ian Ribeiro},
  journal= {arXiv preprint arXiv:2211.09527},
  year   = {2022}
}

备注

ML Safety Workshop NeurIPS 2022