中文

MIP:基于 CLIP 的 PEFT 梯度图像重建

计算机视觉与模式识别 2024-03-14 v1 机器学习

摘要

对比语言-图像预训练(CLIP)模型作为一种有效的预训练多模态神经网络,已被广泛应用于分布式机器学习任务,尤其是联邦学习(FL)。通常,基于 CLIP 的联邦学习采用参数高效微调(PEFT)进行模型训练,仅微调适配器参数或软提示,而非全部参数。尽管 PEFT 不同于传统的训练模式,本文从理论上分析指出,适配器或软提示的梯度仍可被用于执行图像重建攻击。基于我们的理论分析,我们提出了 Multm-In-Parvo(MIP),这是一种针对基于 CLIP 的分布式机器学习架构的专有重建攻击方法。具体而言,MIP 能够根据软提示或适配器的梯度重建 CLIP 训练图像。此外,MIP 包含一个标签预测策略以加速收敛,以及一个逆梯度估计机制以避免文本编码器上的梯度消失问题。实验结果表明,MIP 能够根据 CLIP 模型的软提示或适配器梯度有效地重建训练图像。

关键词

引用

@article{arxiv.2403.07901,
  title  = {MIP: CLIP-based Image Reconstruction from PEFT Gradients},
  author = {Peiheng Zhou and Ming Hu and Xiaofei Xie and Yihao Huang and Kangjie Chen and Mingsong Chen},
  journal= {arXiv preprint arXiv:2403.07901},
  year   = {2024}
}