中文

评估大语言模型遵循指令对提示注入的鲁棒性

计算与语言 2023-11-28 v3 人工智能

摘要

大语言模型(LLMs)在指令遵循方面展现出卓越能力,在各应用中愈发关键。然而,该能力带来了提示注入攻击的风险,攻击者向LLM输入中注入指令以引发不良操作或内容。理解LLM对此类攻击的鲁棒性对其安全部署至关重要。本工作中,我们建立基准评估指令遵循型LLM抵御提示注入攻击的鲁棒性。我们的目标是确定LLM受注入指令影响的程度,及其区分注入指令与原始目标指令的能力。通过对主流指令遵循LLM的广泛实验,我们揭示了其在此类攻击鲁棒性上的显著漏洞。结果表明,部分模型过度调优以遵循提示中任意嵌入的指令,过度关注提示后部而未充分理解整体语境。相比之下,对语境与指令遵循能力把握更好的模型反而更易被注入指令攻破。这凸显出需将重心从单纯提升LLM指令遵循能力,转向改进其对提示的整体理解及应遵从指令的辨别力。希望我们的深入分析能揭示这些漏洞的深层原因,助力未来解决方案的开发。代码与数据见 https://github.com/Leezekun/instruction-following-robustness-eval

关键词

引用

@article{arxiv.2308.10819,
  title  = {Evaluating the Instruction-Following Robustness of Large Language Models to Prompt Injection},
  author = {Zekun Li and Baolin Peng and Pengcheng He and Xifeng Yan},
  journal= {arXiv preprint arXiv:2308.10819},
  year   = {2023}
}

备注

The data and code can be found at https://github.com/Leezekun/instruction-following-robustness-eval