中文

Virus:针对大语言模型的有害微调攻击绕过警戒 Moderation

密码学与安全 2025-01-30 v1 人工智能 计算与语言 机器学习

摘要

最近的研究表明,大语言模型(LLM)易受有害微调攻击——在对少量有害样本进行微调后,模型会丧失安全对齐能力。为降低风险,通常会使用警戒(guardrail)来筛选有害样本。在本文中,我们通过设计一种新的红队测试方法,展示了仅依赖警戒进行数据筛选并不可靠。我们提出的攻击方法称为 Virus,通过轻微修改有害数据即可轻松绕过警戒 Moderation。实验结果表明,Virus 优化后的有害数据在警戒系统下检测不到,且可同时实现卓越的攻击效果。最后,我们希望通过本文传递的核心信息是:\textbf{将警戒 Moderation 视为应对有害微调攻击的救命稻草是不明智的,因为它无法解决预训练大语言模型固有的安全问题}。我们的代码已公开于 https://github.com/git-disl/Virus。

关键词

引用

@article{arxiv.2501.17433,
  title  = {Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation},
  author = {Tiansheng Huang and Sihao Hu and Fatih Ilhan and Selim Furkan Tekin and Ling Liu},
  journal= {arXiv preprint arXiv:2501.17433},
  year   = {2025}
}