面向大型视觉-语言模型的图像扰动启发式成员推理攻击
计算机视觉与模式识别
2026-02-05 v3 密码学与安全
摘要
大型视觉-语言模型(LVLMs)在许多下游任务中展现了卓越性能。然而,LVLMs 是在大规模数据集上训练的,如果训练图像包含敏感信息,可能会带来隐私风险。因此,检测一张图像是否被用于训练 LVLM 非常重要。近期研究已探讨了针对 LVLMs 的成员推理攻击(MIAs),包括检测图像-文本对和单模态内容。在本工作中,我们专注于检测目标图像是否被用于训练目标 LVLM。我们设计了简单而有效的图像扰动启发式成员推理攻击(ICIMIA),其灵感来源于 LVLM 对成员和非成员图像在图像扰动方面的不同敏感性。我们首先在白盒设置下执行 MIA 方法,可以通过目标 LVLM 的视觉部分获取图像的嵌入。攻击基于图像与其扰动版本之间的嵌入相似性。我们进一步探索了更实际的场景,即我们对目标 LVLM 没有任何了解,只能使用图像和文本指令对目标 LVLM 进行查询。然后,我们利用输出文本嵌入的相似性执行攻击。在现有数据集上的实验验证了我们所提出方法在两种不同设置下的有效性。
引用
@article{arxiv.2506.12340,
title = {Image Corruption-Inspired Membership Inference Attacks against Large Vision-Language Models},
author = {Zongyu Wu and Minhua Lin and Zhiwei Zhang and Fali Wang and Xianren Zhang and Xiang Zhang and Suhang Wang},
journal= {arXiv preprint arXiv:2506.12340},
year = {2026}
}
备注
Accepted by EACL 2026