中文

修改提示词的蝴蝶效应:微小改变与越狱如何影响大型语言模型性能

计算与语言 2024-04-03 v3 人工智能

摘要

大型语言模型(LLMs)经常被用于跨多个领域和 myriad 任务的数据标注。只需向 LLM 询问答案或进行“提示”,从业者就能使用 LLM 快速获得任意任务的响应。这种提示过程是通过从业者的一系列决策完成的,从简单的提示词措辞,到要求以特定数据格式输出,再到针对更敏感主题的提示词进行越狱。在这项工作中,我们提出一个问题:提示词构建方式的变化会改变 LLM 的最终决策吗?我们通过在各种文本分类任务上的一系列提示词变体来回答这个问题。我们发现,即使是最微小的扰动,例如在提示词末尾添加一个空格,也可能导致 LLM 改变其答案。此外,我们发现要求以 XML 格式响应以及常用的越狱手段可能对 LLM 标注的数据产生灾难性影响。

关键词

引用

@article{arxiv.2401.03729,
  title  = {The Butterfly Effect of Altering Prompts: How Small Changes and Jailbreaks Affect Large Language Model Performance},
  author = {Abel Salinas and Fred Morstatter},
  journal= {arXiv preprint arXiv:2401.03729},
  year   = {2024}
}