中文

语言模型非对齐:以参数化红队测试揭示隐藏危害与偏见

计算与语言 2023-11-14 v2

摘要

红队测试(red-teaming)已被广泛采用以评估大语言模型(LLMs)的有害性。其旨在越狱模型的安全行为,使其充当无视查询有害性的有用代理。现有方法主要基于输入文本的红队测试,例如对抗性提示、低资源提示或上下文提示,以某种方式调节模型从而绕过其安全行为。绕过防护栏可揭示模型中未经处理或由安全训练新引入的隐藏有害信息与偏见。然而,基于提示的攻击由于其低攻击成功率及仅适用于特定模型,无法提供此类诊断。本文提出LLM安全研究的新视角,即通过非对齐(Unalignment)进行参数化红队测试。它仅通过(指令)微调模型参数来打破并未深植于模型行为中的防护栏。使用少至100个样本的非对齐即可显著绕过通常所称的CHATGPT,使其在两份安全基准数据集上对有害查询以88%的成功率作出响应。在VICUNA-7B、LLAMA-2-CHAT 7B与13B等开源模型上,其攻击成功率超过91%。在偏见评估中,非对齐揭示了安全对齐模型(如CHATGPT与LLAMA-2-CHAT)中固有的偏见,其中模型响应有64%的时间表现出强烈偏见与主观倾向。

关键词

引用

@article{arxiv.2310.14303,
  title  = {Language Model Unalignment: Parametric Red-Teaming to Expose Hidden Harms and Biases},
  author = {Rishabh Bhardwaj and Soujanya Poria},
  journal= {arXiv preprint arXiv:2310.14303},
  year   = {2023}
}

备注

Under Review