中文

通过剪枝和低秩修改评估安全对齐的脆弱性

机器学习 2024-10-28 v4 人工智能 计算与语言

摘要

大型语言模型(LLMs)在其安全机制中表现出固有的脆弱性,这体现在它们易受越狱攻击甚至非恶意微调的影响。本研究通过利用剪枝和低秩修改来探索这种安全对齐的脆弱性。我们开发了方法来识别对安全防护至关重要的关键区域,并且这些区域在神经元和秩层面与效用相关的区域是解耦的。令人惊讶的是,我们发现的关键区域是稀疏的,在参数层面约占 3%3\%,在秩层面约占 2.5%2.5\%。移除这些区域会损害安全性,而不会显著影响效用,这证实了模型安全机制固有的脆弱性。此外,我们表明,即使限制对安全关键区域的修改,LLM 仍然容易受到低成本微调攻击。这些发现强调了在 LLM 中制定更鲁棒安全策略的迫切需求。

关键词

引用

@article{arxiv.2402.05162,
  title  = {Assessing the Brittleness of Safety Alignment via Pruning and Low-Rank Modifications},
  author = {Boyi Wei and Kaixuan Huang and Yangsibo Huang and Tinghao Xie and Xiangyu Qi and Mengzhou Xia and Prateek Mittal and Mengdi Wang and Peter Henderson},
  journal= {arXiv preprint arXiv:2402.05162},
  year   = {2024}
}

备注

22 pages, 9 figures. Project page is available at https://boyiwei.com/alignment-attribution/