中文

恢复生成模型的预微调权重

机器学习 2024-07-02 v2 计算与语言 密码学与安全 计算机视觉与模式识别

摘要

生成建模的主流范式包含两个步骤:i) 在大规模但不安全的数据集上进行预训练,ii) 通过微调使预训练模型与人类价值观对齐。这种做法被认为是安全的,因为目前尚无方法能够恢复不安全的预微调模型权重。在本文中,我们证明这一假设往往是错误的。具体而言,我们提出了谱去微调 (Spectral DeTuning) 方法,该方法可以利用少量低秩 (LoRA) 微调模型来恢复预微调模型的权重。与以往试图恢复预微调能力的攻击不同,我们的方法旨在恢复精确的预微调权重。我们的方法利用了这一新漏洞,针对大规模模型(如个性化 Stable Diffusion 和对齐后的 Mistral)进行了攻击。

关键词

引用

@article{arxiv.2402.10208,
  title  = {Recovering the Pre-Fine-Tuning Weights of Generative Models},
  author = {Eliahu Horwitz and Jonathan Kahana and Yedid Hoshen},
  journal= {arXiv preprint arXiv:2402.10208},
  year   = {2024}
}

备注

ICML 2024. Project page: https://vision.huji.ac.il/spectral_detuning/