面向有害微调的靶向疫苗:通过层级扰动实现大型语言模型的安全对齐
机器学习
2025-02-03 v3
摘要
有害微调攻击构成了对在线微调服务的严重威胁。疫苗(Vaccine)是一种最近的对齐阶段防御措施,对嵌入的所有层施加均匀扰动,以使模型对模拟的嵌入漂移具有鲁棒性。然而,对所有层施加层级均匀扰动可能导致某些特定与安全无关的层产生过大扰动,从而导致防御性能下降和不必要的内存消耗。为此,本文提出一种靶向疫苗(T-Vaccine),这是一种内存高效的安全对齐方法,仅对选定模型层施加扰动。T-Vaccine包含两个核心步骤:首先,使用梯度范数作为统计指标识别安全关键层;其次,T-Vaccine仅对安全关键层施加扰动,而在训练期间保持其他层冻结。结果表明,T-Vaccine在防御有效性和资源效率方面均优于Vaccine。与其他防御基线方法(如RepNoise和TAR)的比较也显示出T-Vaccine的优势。值得注意的是,T-Vaccine是首个能够针对在消费级GPU(如RTX 4090)上运行的7B参数预训练模型解决有害微调问题的防御方法。我们的代码已公开:https://github.com/Lslland/T-Vaccine。
引用
@article{arxiv.2410.09760,
title = {Targeted Vaccine: Safety Alignment for Large Language Models against Harmful Fine-Tuning via Layer-wise Perturbation},
author = {Guozhi Liu and Weiwei Lin and Tiansheng Huang and Ruichao Mo and Qi Mu and Li Shen},
journal= {arXiv preprint arXiv:2410.09760},
year = {2025}
}