剪枝以增强防护:无需微调即可提升对齐大语言模型的越狱抵抗能力
机器学习
2024-11-01 v3 人工智能
计算与语言
密码学与安全
摘要
本文研究了模型压缩对大语言模型(LLM)处理提示词方式的影响,特别是关于越狱抵抗能力方面。我们表明,适度的 WANDA 剪枝可以在无需微调的情况下增强对越狱攻击的抵抗能力,同时保持在标准基准测试上的性能。为了系统地评估这种安全增强效果,我们引入了一个包含五个类别共 225 个有害任务的数据集。我们对 LLaMA-2 Chat、Vicuna 1.3 和 Mistral Instruct v0.2 的分析表明,剪枝带来的益处与模型的初始安全水平相关。我们通过检查注意力模式的变化和困惑度(perplexity)的偏移来解释这些结果,证明了剪枝后的模型表现出更敏锐的注意力以及对人工越狱构造更高的敏感性。我们将评估扩展到了 AdvBench 有害行为任务和 GCG 攻击方法。我们发现,在使用手动越狱尝试进行评估时,LLaMA-2 在 AdvBench 提示词上的安全性远高于在我们的数据集上,并且剪枝对 AdvBench 上的自动化攻击和手动越狱均有效。
引用
@article{arxiv.2401.10862,
title = {Pruning for Protection: Increasing Jailbreak Resistance in Aligned LLMs Without Fine-Tuning},
author = {Adib Hasan and Ileana Rugina and Alex Wang},
journal= {arXiv preprint arXiv:2401.10862},
year = {2024}
}
备注
Proceedings of the 7th BlackboxNLP Workshop: Analyzing and Interpreting Neural Networks for NLP