CTRAP:嵌入式坍塌陷阱以保护大型语言模型免受有害微调
密码学与安全
2025-05-23 v1 计算与语言
摘要
微调即服务(FTaaS)虽然在大型语言模型(LLM)提供商那里取得了商业成功,却将模型暴露于有害微调攻击之下。作为针对此类攻击的广泛探索的防御范式,遗忘尝试从 LLM 中移除恶意知识,从而本质上防止它们被用于执行恶意任务。然而,我们指出一个关键缺陷:LLM 的强大通用适应性使其能够轻易通过快速重学习或重新利用其能力来规避选择性遗忘。为此,我们提出范式的根本性转变:而非选择性移除,我们主张诱导模型坍塌——即对具有恶意适应特征的更新特有的“遗忘一切”——这直接中和攻击者所利用的通用能力,解决选择性遗忘未能解决的核心问题。我们引入坍塌陷阱(CTRAP)作为实际实现此概念的机制。CTRAP 在对齐期间嵌入,预先配置了模型对后续微调动力学的反应。如果微调期间的更新构成持续尝试逆转安全对齐的行为,预先配置的陷阱将触发模型核心语言建模能力的逐步退化,最终使其对攻击者无用且无用。至关重要的是,此坍塌机制在良性微调期间保持 dormant,确保模型的实用性和通用能力为合法用户所保留。大量实证结果表明,CTRAP 在各种 LLM 和攻击设置下有效抵御有害微调风险,同时在良性场景中保持高性能。我们的代码已在 https://anonymous.4open.science/r/CTRAP 上提供。
引用
@article{arxiv.2505.16559,
title = {CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning},
author = {Biao Yi and Tiansheng Huang and Baolei Zhang and Tong Li and Lihai Nie and Zheli Liu and Li Shen},
journal= {arXiv preprint arXiv:2505.16559},
year = {2025}
}