中文

PromptRobust:面向大语言模型在对抗性提示上鲁棒性的评估

计算与语言 2024-07-17 v5 密码学与安全 机器学习

摘要

学术界与工业界对大语言模型(LLMs)的依赖日益加深,这要求我们全面理解其对提示的鲁棒性。为回应这一重要需求,我们提出了 PromptRobust,一个用于衡量 LLM 对对抗性提示抵御能力的鲁棒性基准。本研究使用了大量针对提示的对抗性文本攻击,涵盖字符、词、句子和语义多个层面。这些对抗性提示旨在模拟用户输入错误(如错别字或同义词),在保持语义完整性的同时评估微小偏差如何影响 LLM 的输出。随后,这些提示被应用于多种任务,包括情感分析、自然语言推理、阅读理解、机器翻译和数学解题。我们的研究生成了 4,788 条对抗性提示,并在 8 项任务和 13 个数据集上进行了细致评估。研究结果表明,当代 LLM 对对抗性提示并不鲁棒。此外,我们给出了全面分析以理解提示鲁棒性及其可迁移性背后的机理,并提供了关于提示构建的深刻鲁棒性分析与实用建议,惠及研究者和普通用户。

关键词

引用

@article{arxiv.2306.04528,
  title  = {PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts},
  author = {Kaijie Zhu and Jindong Wang and Jiaheng Zhou and Zichen Wang and Hao Chen and Yidong Wang and Linyi Yang and Wei Ye and Yue Zhang and Neil Zhenqiang Gong and Xing Xie},
  journal= {arXiv preprint arXiv:2306.04528},
  year   = {2024}
}

备注

Technical report; code is at: https://github.com/microsoft/promptbench