CloakDiff:针对视觉语言模型基于文本查询攻击的可逆高保真隐私保护框架
计算机视觉与模式识别
2026-07-11 v1
摘要
视觉语言模型(VLM)提供了强大的多模态能力,但也使用户面临基于文本的隐私攻击,攻击者可以通过在线查询提取敏感属性。现有的可逆对抗样本(RAE)方法在纯视觉任务中表现良好,但在多模态环境中却失效了,且当前针对VLM的对抗样本依赖于高频噪声,严重损害了视觉质量。我们提出了CloakDiff,这是第一个针对VLM中基于文本查询攻击的可逆、高保真隐私保护框架。CloakDiff通过将基于扩散的对抗编辑与用于无损恢复原始图像的可逆网络相结合,生成难以察觉的对抗样本。它既扰动像素空间嵌入,又操纵潜在交叉注意力图,以确保强大的跨模型和跨提示可迁移性,同时保持全局视觉结构。为了进一步提高保真度,我们设计了EDM启发式采样,这是一种用于对抗引导的原理性扩散调度。在多个数据集和VLM上的实验表明,CloakDiff在提供多模态隐私保护的同时,实现了高视觉质量和可逆性。
关键词
引用
@article{arxiv.2607.10329,
title = {Imperceptible and Reversible Adversarial Examples against Vision-Language Models for Privacy Protection},
author = {Qi Lu and Ziqi Zhou and Yufei Song and Zijing Li and Lulu Xue and Minghui Li and Shengshan Hu and Leo Yu Zhang},
journal= {arXiv preprint arXiv:2607.10329},
year = {2026}
}
备注
Accepted by ACM MM 2026