评估大语言模型安全性的因果分析
人工智能
2023-12-14 v1
摘要
诸如GPT和Llama2等大语言模型(LLMs)正越来越多地被应用于许多安全关键型应用中。因此,它们的安全性至关重要。尽管在基于人类反馈的强化学习(RLHF)上投入了大量精力,但近期研究表明,LLMs仍然容易受到对抗性扰动和木马攻击等威胁。因此,需要进一步研究来评估其安全性及/或理解其安全性缺失的原因。在这项工作中,我们提出了一个框架,用于在令牌、层和神经元级别对LLMs进行轻量级因果分析。我们将该框架应用于Llama2和Vicuna等开源LLMs,并获得了多项有趣的发现。基于层级因果分析,我们表明RLHF具有使模型对有害提示过拟合的效应。这意味着这种安全性很容易被“不寻常”的有害提示所克服。作为证据,我们提出了一种对抗性扰动方法,在2023年木马检测竞赛的红队测试任务中实现了100%的攻击成功率。此外,我们揭示了在Llama2和Vicuna中均存在一个神秘的神经元,它对输出具有异常高的因果效应。虽然我们尚不确定为何存在这样的神经元,但我们表明,可以针对该特定神经元实施“木马”攻击,从而完全瘫痪LLM,即我们可以生成可迁移的后缀,添加到提示中,频繁地使LLM产生无意义的响应。
引用
@article{arxiv.2312.07876,
title = {Causality Analysis for Evaluating the Security of Large Language Models},
author = {Wei Zhao and Zhe Li and Jun Sun},
journal= {arXiv preprint arXiv:2312.07876},
year = {2023}
}