中文

良性样本至关重要!在异常良性样本上微调严重破坏安全性

机器学习 2025-05-27 v2 计算与语言

摘要

近期研究揭示了大语言模型(LLM)微调阶段的一个令人担忧的漏洞:即使在完全良性数据集上微调,也会显著增加 LLM 输出的有害性。基于这一发现,我们的红队攻击研究进一步深化了这一威胁。具体而言,我们分析并识别了贡献最大于安全性降解的良性样本,然后仅在这些样本上进行微调。我们从异常检测视角出发,提出 Self-Inf-N 方法,用于检测并提取异常样本进行微调。我们的发现表明,在良性数据集中通过 Self-Inf-N 选取的 100 个异常样本进行微调,会严重损害 LLM 安全对齐。跨七个主流 LLM 的大量实验表明,本次攻击在不同架构之间具有高可迁移性,并在实际场景中保持有效性。令人警惕的是,我们的结果表明,大多数现有缓解策略均无法防御此类攻击,凸显了需要更稳健的对齐安全措施的紧迫性。代码已公开于 https://github.com/GuanZihan/Benign-Samples-Matter。

关键词

引用

@article{arxiv.2505.06843,
  title  = {Benign Samples Matter! Fine-tuning On Outlier Benign Samples Severely Breaks Safety},
  author = {Zihan Guan and Mengxuan Hu and Ronghang Zhu and Sheng Li and Anil Vullikanti},
  journal= {arXiv preprint arXiv:2505.06843},
  year   = {2025}
}

备注

26 pages, 13 figures