SUA:一种隐蔽的多模态大语言模型无学习攻击
机器学习
2025-09-23 v2 人工智能
摘要
在大规模数据上训练的多模态大语言模型(MLLMs)可能会记忆敏感个人信息和照片,构成严重的隐私风险。为缓解这一问题,提出了MLLM无学习方法,通过微调MLLM以减少对“忘记”敏感信息的依赖。然而,仍不清楚所学知识是否真正被遗忘,还是仅仅被隐藏在模型中。因此,我们提出了一种新的LLM无学习攻击问题,即旨在恢复被无学习的LLM的知识。为实现这一目标,我们提出了一种新的框架SUA(Stealthy Unlearning Attack)框架,学习一种通用噪声模式。当应用于输入图像时,这种噪声可以触发模型透露未被遗忘的内容。虽然像素级扰动可能在视觉上微弱,但在语义嵌入空间中可能被检测,从而暴露于潜在防御之下。为提高隐蔽性,我们引入了一种嵌入对齐损失,以最小化扰动图像和去噪图像之间的嵌入差异,确保攻击在语义上不可察觉。实验结果表明,SUA能够有效恢复MLLM中遗忘的信息。 Furthermore, 所学到的噪声具有很好的概括性:一个在子集样本上训练的单个扰动可以揭示在未见图像中被遗忘的内容。这表明知识的重新出现并非偶然的失败,而是一种一致的行为。
引用
@article{arxiv.2506.17265,
title = {SUA: Stealthy Multimodal Large Language Model Unlearning Attack},
author = {Xianren Zhang and Hui Liu and Delvin Ce Zhang and Xianfeng Tang and Qi He and Dongwon Lee and Suhang Wang},
journal= {arXiv preprint arXiv:2506.17265},
year = {2025}
}
备注
EMNLP25