潜在越狱:评估大语言模型文本安全性与输出鲁棒性的基准
计算与语言
2023-08-29 v3
摘要
大量研究工作致力于确保大语言模型(LLMs)符合人类价值观并生成安全文本。然而,对某些话题过度敏感会损害模型遵循指令的鲁棒性,从而影响其完成任务的整体表现。以往针对LLM越狱的基准主要聚焦于模型安全性评估,而未考虑其鲁棒性。本文提出一种同时评估LLM安全性与鲁棒性的基准,强调需采取平衡方法。为全面研究文本安全性与输出鲁棒性,我们引入了一个潜在越狱提示数据集,每个样本均包含嵌入的恶意指令。具体而言,我们指示模型完成一项常规任务(如翻译),而待翻译文本中含有恶意指令。为进一步分析安全性与鲁棒性,我们设计了一个分层标注框架。我们针对显式正常指令的位置、词语替换(显式正常指令中的动词、恶意指令中的目标群体、显式正常指令的提示词)以及指令替换(不同的显式正常指令),对LLM的安全性和鲁棒性进行了系统分析。结果表明,当前LLM不仅优先关注某些指令动词,且对显式正常指令中不同指令动词表现出各异的越狱率。代码与数据见 https://github.com/qiuhuachuan/latent-jailbreak。
引用
@article{arxiv.2307.08487,
title = {Latent Jailbreak: A Benchmark for Evaluating Text Safety and Output Robustness of Large Language Models},
author = {Huachuan Qiu and Shuai Zhang and Anqi Li and Hongliang He and Zhenzhong Lan},
journal= {arXiv preprint arXiv:2307.08487},
year = {2023}
}
备注
Code and data are available at https://github.com/qiuhuachuan/latent-jailbreak