中文

LUMIA:面向单模态与多模态成员推断攻击的线性探针方法

密码学与安全 2025-01-13 v3 人工智能

摘要

大型语言模型(LLM)在众多应用中日益广泛使用,但围绕成员推断的担忧也随之增长。以前的工作侧重于黑盒到灰盒模型,忽略了从内部 LLM 信息中获益的潜力。为此,我们提出使用线性探针(Linear Probes, LPs)作为检测成员推断攻击(Membership Inference Attacks, MIAs)的方法,通过检查 LLM 的内部激活。我们称之为 LUMIA。该方法逐层应用 LPs 以获得模型内部工作细节的数据。我们在多个模型架构、规模和数据集上进行测试,包括单模态和多模态任务。在单模态 MIA 中,LUMIA 在 AUC 上的平均提升为 15.71%。值得注意的是,LUMIA 在 65.33% 的情况下实现 AUC>60%,相当于对现有技术提升了 46.80%。此外,我们的方法揭示了 MIA 最可检测的模型层。对于多模态模型,LPs 表明视觉输入可显著贡献于检测 MIA——在 85.90% 的实验中实现 AUC>60%。

关键词

引用

@article{arxiv.2411.19876,
  title  = {LUMIA: Linear probing for Unimodal and MultiModal Membership Inference Attacks leveraging internal LLM states},
  author = {Luis Ibanez-Lissen and Lorena Gonzalez-Manzano and Jose Maria de Fuentes and Nicolas Anciaux and Joaquin Garcia-Alfaro},
  journal= {arXiv preprint arXiv:2411.19876},
  year   = {2025}
}