中文

提示注入攻击下大语言模型机器翻译的缩放行为

计算与语言 2024-03-18 v1

摘要

大语言模型(LLM)正日益成为许多自然语言处理任务(如机器翻译)的首选基础平台,这得益于其质量通常与任务特定模型相当或更好,以及通过自然语言指令或上下文示例指定任务的简便性。然而,它们的通用性使其容易受到最终用户的颠覆,用户可能在其请求中嵌入指令,导致模型以未经授权且可能不安全的方式运行。在这项工作中,我们在机器翻译任务上研究了多个LLM家族的这些提示注入攻击(PIA),重点关注模型大小对攻击成功率的影响。我们引入了一个新的基准数据集,并发现对于多个语言对和用英语编写的注入提示,在某些条件下,较大的模型可能变得更容易受到成功的攻击,这是逆缩放现象的一个实例(McKenzie等人,2023)。据我们所知,这是第一个在多语言环境中研究非平凡LLM缩放行为的工作。

关键词

引用

@article{arxiv.2403.09832,
  title  = {Scaling Behavior of Machine Translation with Large Language Models under Prompt Injection Attacks},
  author = {Zhifan Sun and Antonio Valerio Miceli-Barone},
  journal= {arXiv preprint arXiv:2403.09832},
  year   = {2024}
}

备注

15 pages, 18 figures, First Workshop on the Scaling Behavior of Large Language Models (SCALE-LLM 2024)