Virus:针对大语言模型的有害微调攻击绕过警戒 Moderation
密码学与安全
2025-01-30 v1 人工智能
计算与语言
机器学习
摘要
最近的研究表明,大语言模型(LLM)易受有害微调攻击——在对少量有害样本进行微调后,模型会丧失安全对齐能力。为降低风险,通常会使用警戒(guardrail)来筛选有害样本。在本文中,我们通过设计一种新的红队测试方法,展示了仅依赖警戒进行数据筛选并不可靠。我们提出的攻击方法称为 Virus,通过轻微修改有害数据即可轻松绕过警戒 Moderation。实验结果表明,Virus 优化后的有害数据在警戒系统下检测不到,且可同时实现卓越的攻击效果。最后,我们希望通过本文传递的核心信息是:\textbf{将警戒 Moderation 视为应对有害微调攻击的救命稻草是不明智的,因为它无法解决预训练大语言模型固有的安全问题}。我们的代码已公开于 https://github.com/git-disl/Virus。
关键词
引用
@article{arxiv.2501.17433,
title = {Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation},
author = {Tiansheng Huang and Sihao Hu and Fatih Ilhan and Selim Furkan Tekin and Ling Liu},
journal= {arXiv preprint arXiv:2501.17433},
year = {2025}
}