SOPHON:限制预训练模型任务可迁移性的不可微调学习
机器学习
2024-04-22 v1
摘要
开发者越来越依赖于将预训练模型适配到其自定义任务,而非从头构建深度学习模型。然而,强大的预训练模型可能会被滥用于不道德或非法任务,例如隐私推断和不安全内容生成。在本文中,我们引入了一种开创性的学习范式——不可微调学习,它在保持预训练模型在原始任务上性能的同时,防止其被微调至不当任务。为实现这一目标,我们提出了 SOPHON,这是一个保护框架,可增强给定预训练模型对在预定义受限领域内进行微调的抵抗力。然而,由于对手可能采用多种复杂的微调策略,这极具挑战性。受与模型无关的元学习启发,我们通过设计复杂的微调模拟和微调评估算法克服了这一困难。此外,我们精心设计了优化过程,将预训练模型困在关于受限领域的难以逃脱的局部最优解中。我们在两种深度学习模式(分类和生成)、七个受限领域和六种模型架构上进行了广泛实验,以验证 SOPHON 的有效性。实验结果验证了对受 SOPHON 保护的模型进行微调会产生与从头训练相当甚至更大的开销。此外,我们确认了 SOPHON 对三种微调方法、五种优化器、各种学习率和批大小的鲁棒性。SOPHON 可能有助于推动对安全且负责任的 AI 的进一步研究。
引用
@article{arxiv.2404.12699,
title = {SOPHON: Non-Fine-Tunable Learning to Restrain Task Transferability For Pre-trained Models},
author = {Jiangyi Deng and Shengyuan Pang and Yanjiao Chen and Liangming Xia and Yijie Bai and Haiqin Weng and Wenyuan Xu},
journal= {arXiv preprint arXiv:2404.12699},
year = {2024}
}
备注
Accepted by IEEE Symposium on Security and Privacy 2024