CROW:通过内部一致性正则化消除大语言模型中的后门
计算与语言
2025-06-12 v2 人工智能
机器学习
摘要
大型语言模型 (LLM) 容易受到后门攻击,此类攻击通过隐藏触发器操纵模型输出。现有的防御方法——专为视觉/文本分类任务设计——在文本生成任务中失效。我们提出了内部一致性正则化 (CROW),这是一种利用以下观察结果的防御方法:受触发时,被植入后门的模型表现出不稳定的逐层隐藏表示,而干净的模型则表现出平滑的过渡。CROW 在微调期间通过对抗扰动和正则化来强制各层之间的一致性,在不需要干净参考模型或触发器知识的情况下消除后门——仅需一个小型干净数据集。在 Llama-2 (7B, 13B)、CodeLlama (7B, 13B) 和 Mistral-7B 上的实验证明了 CROW 的有效性:它在保留生成性能的同时,显著降低了多种后门策略(情感引导、定向拒绝、代码注入)的攻击成功率。CROW 的架构无关设计使其能够实际部署。
引用
@article{arxiv.2411.12768,
title = {CROW: Eliminating Backdoors from Large Language Models via Internal Consistency Regularization},
author = {Nay Myat Min and Long H. Pham and Yige Li and Jun Sun},
journal= {arXiv preprint arXiv:2411.12768},
year = {2025}
}
备注
Accepted at ICML 2025, 20 pages