针对视觉语言模型的单样本黑盒成员推断攻击:基于跨模态语义对齐
计算机视觉与模式识别
2026-05-19 v1 人工智能
摘要
视觉语言模型(VLM)取得了显著进展,但其依赖大规模数据集并不可避免地记忆训练数据,引发显著数据安全风险。成员推断攻击(MIA)旨在评估这些风险,通过判断数据样本是否包含在模型训练集中。然而,现有针对VLM的方法存在关键瓶颈:灰盒方法依赖内部logits,在实际API限制下难以应用;黑盒方法依赖大规模统计分布,在单样本场景下力不从众。针对此问题,我们从跨模态语义对齐角度进行研究,发现成员图像因训练记忆而显示出显著更强的图像-描述对齐,而非成员生成描述可能偏离原始视觉内容。基于此洞察,我们提出一种专为严格黑盒和单样本场景设计的新型MIA框架,通过联合嵌入空间量化此类对齐,从而绕过不切实际的假设。我们在三个开源VLM和两个闭源VLM上进行了大规模实验。在VL-MIA/Flicker数据集上,我们的方法对LLaVA-1.5的AUC达到0.821,显著优于现有基线方法。此外,该方法在多种图像扰动下仍保持鲁棒性,凸显其实用性。
引用
@article{arxiv.2605.17341,
title = {Single-Sample Black-Box Membership Inference Attack against Vision-Language Models via Cross-modal Semantic Alignment},
author = {Jiaqing Li and Yajuan Lu and Xiaochuan Shi and Gang Wu and ZhongYuan Wang and Chao Liang},
journal= {arXiv preprint arXiv:2605.17341},
year = {2026}
}