从条件数视角看模型免疫
机器学习
2025-05-30 v1
摘要
模型免疫旨在预训练出难以在有害任务上进行微调,同时又能保持其在其他无害任务上效用的模型。尽管先前的工作展示了为文本到图像模型进行免疫的经验证据,但关于何时能够实现免疫的关键理解,以及对免疫模型的精确定义,仍不清晰。在这项工作中,我们提出了一个基于 Hessian 矩阵条件数的框架,用于分析线性模型的模型免疫。在此框架的基础上,我们设计了一种带有正则化项的算法,以控制预训练后所得的条件数。在线性模型和非线性深度网络上的实验结果证明了所提算法在模型免疫方面的有效性。代码可在 https://github.com/amberyzheng/model-immunization-cond-num 获取。
引用
@article{arxiv.2505.23760,
title = {Model Immunization from a Condition Number Perspective},
author = {Amber Yijia Zheng and Cedar Site Bai and Brian Bullins and Raymond A. Yeh},
journal= {arXiv preprint arXiv:2505.23760},
year = {2025}
}
备注
ICML 2025