表示噪声:针对有害微调的防御机制
动力系统
2024-05-30 v2
摘要
发布开源大型语言模型 (LLM) 存在双刃剑风险,因为恶意行为者可以轻易对这些模型进行有害微调。即使不公开权重,权重窃取和 API 微调也会使封闭模型易受有害微调攻击 (HFA)。虽然防止越狱和改进安全警戒措施很重要,但这些措施可以通过微调轻易被反转。本文提出了表示噪声 (RepNoise),一种即使攻击者获取权重也能运行的防御机制。RepNoise 通过移除有害表示相关的知识,从而在微调期间难以恢复它们。重要的是,我们的防御还能针对在防御过程中未看到的不同有害子集进行泛化,只要它们来自攻击集合的同一分布。我们的方法不会降低 LLM 的通用能力,仍能训练模型以无害任务为目标。我们提供实证证据表明,防御的有效性体现在其“深度”:即有害表示信息在 LLM 的所有层中被移除的程度。我们还发现 RepNoise 仍然不够有效的领域,并指出这些限制如何能为未来研究提供指导。
引用
@article{arxiv.2405.14576,
title = {Finding bifurcations in mathematical epidemiology via reaction network methods},
author = {Nicola Vassena and Florin Avram and Rim Adenane},
journal= {arXiv preprint arXiv:2405.14576},
year = {2024}
}
备注
41 Pages, 3 figures