中文

通过混合编码防御提示注入攻击

计算与语言 2025-04-11 v1

摘要

大语言模型已成为处理广泛NLP任务的主流方法,其对外部信息的访问进一步增强了能力。然而,这也引入了新的漏洞,即提示注入攻击,其中外部内容嵌入了操纵LLM输出的恶意指令。最近,Base64防御被认为是降低提示注入攻击成功率的最有效方法之一。尽管有效,但该方法可能会降低LLM在某些NLP任务上的性能。为应对这一挑战,我们提出了一种新颖的防御机制:混合编码,它利用多种字符编码,包括Base64。大量实验结果表明,我们的方法在提示注入攻击下实现了最低的攻击成功率之一,同时在所有NLP任务上保持了高性能,优于现有的基于字符编码的防御方法。这突显了我们的混合编码策略在安全性和任务性能指标上的有效性。

关键词

引用

@article{arxiv.2504.07467,
  title  = {Defense against Prompt Injection Attacks via Mixture of Encodings},
  author = {Ruiyi Zhang and David Sullivan and Kyle Jackson and Pengtao Xie and Mei Chen},
  journal= {arXiv preprint arXiv:2504.07467},
  year   = {2025}
}