基于先验知识校准记忆探针的LVLMs黑盒成员推断攻击
密码学与安全
2025-11-05 v1 人工智能
摘要
大型视觉语言模型(LVLMs)的能力源自在大量视觉和文本数据的广泛训练。凭借大规模参数,这些模型常常强烈记住其训练数据,使其易受到成员推断攻击(MIA)。现有LVLMs的MIA方法通常在白盒或灰盒假设下工作,通过从目标LVLMs中提取基于可能性的特征来针对可疑数据样本进行建模。然而,主流LVLMs仅在推理时暴露生成的输出,同时隐藏内部计算特征,这限制了这些方法的适用性。在本工作中,我们提出了一种基于先验知识校准记忆探针机制的LVLMs黑盒MIA框架。核心思想是评估模型对私人语义信息在可疑图像数据中的记忆,这些信息不太可能仅凭一般世界知识就能被推断。我们在四个LVLMs和三个数据集上进行了大量实验。实证结果表明,我们的方法在纯黑盒设置下有效识别LVLMs的训练数据,甚至达到了与灰盒和白盒方法相当的性能。进一步分析揭示了该方法对潜在对抗性操纵的鲁性,以及方法设计的有效性。我们的代码和数据已在https://github.com/spmede/KCMP上提供。
引用
@article{arxiv.2511.01952,
title = {Black-Box Membership Inference Attack for LVLMs via Prior Knowledge-Calibrated Memory Probing},
author = {Jinhua Yin and Peiru Yang and Chen Yang and Huili Wang and Zhiyang Hu and Shangguang Wang and Yongfeng Huang and Tao Qi},
journal= {arXiv preprint arXiv:2511.01952},
year = {2025}
}