LoRA 修补:暴露针对深度伪造的主动防御脆弱性
计算机视觉与模式识别
2025-12-04 v2
摘要
深度伪造构成重大的社会风险,促使开发出在面部图像中嵌入对抗性扰动的主动防御机制。然而,本文指出,这些预防性防御往往缺乏鲁棒性和可靠性。我们提出了一种新方法,低秩适应(LoRA)修补,通过向深度伪造生成器注入即插即用 LoRA 修补以绕过最新防御机制。一个可学习的门控机制适应性地控制 LoRA 修补的作用,并防止在微调期间发生梯度爆炸。我们还引入了多模态特征对齐(MMFA)损失,鼓励对抗输出的特征在语义层面上与所需输出的特征对齐。除绕过防御外,我们还提出了防御性 LoRA 修补,将可见警告嵌入输出中作为补充解决方案,以缓解新确定的安全漏洞。仅需1,000张面部图像和一个 epoch 的微调,LoRA 修补就能成功地击败多种主动防御机制。这些结果揭示了当前范式中的关键弱点,凸显了需要更健壮深度伪造防御策略的必要性。我们的代码可在 https://github.com/ZOMIN28/LoRA-Patching 上找到。
引用
@article{arxiv.2510.03747,
title = {LoRA Patching: Exposing the Fragility of Proactive Defenses against Deepfakes},
author = {Zuomin Qu and Yimao Guo and Qianyue Hu and Wei Lu},
journal= {arXiv preprint arXiv:2510.03747},
year = {2025}
}