中文

面向 LLM 机器翻译的提示注入攻击测试套件

计算与语言 2024-11-20 v1

摘要

LLM 驱动的 NLP 系统通常通过将输入数据嵌入包含指令和/或情境示例的提示模板中,创建查询并提交给 LLM,然后解析 LLM 响应以生成系统输出。提示注入攻击(Prompt Injection Attacks, PIAs)是对这些系统的一种篡改方式,恶意用户会精心设计特殊输入以干扰提示模板,导致 LLM 以系统设计者所不希望的方式作出响应。最近,Sun 和 Miceli-Barone 提出了针对 LLM 机器翻译的 PIAs 类。具体任务是从 TruthfulQA 测试套件中翻译问题,其中会在问题前添加对抗性提示,指示系统忽略翻译指令而是回答问题。 在本测试套件中,我们将这种方法扩展到 WMT 2024 通用机器翻译任务的所有语言对。此外,我们除了原研究中使用的攻击格式外,还包括额外的攻击格式。

关键词

引用

@article{arxiv.2410.05047,
  title  = {A test suite of prompt injection attacks for LLM-based machine translation},
  author = {Antonio Valerio Miceli-Barone and Zhifan Sun},
  journal= {arXiv preprint arXiv:2410.05047},
  year   = {2024}
}