中文

大规模模型上的成员推断攻击综述

机器学习 2025-09-03 v3 密码学与安全

摘要

随着大型语言模型 (Large Language Models, LLMs) 和大型多模态模型 (Large Multimodal Models, LMMs) 的不断部署,其隐私风险仍未得到充分探讨。成员推断攻击 (Membership Inference Attacks, MIAs) 能够揭示某个数据点是否用于训练目标模型,是暴露或评估模型隐私风险的重要技术,已在各种机器学习算法中显示出有效性。尽管对经典模型上 MIA 进行了广泛研究,但仍缺乏系统性地审视大规模模型中 MIA 有效性和局限性的综述。为弥补这一差距,本文提供了针对 LLMs 和 LMMs 的 MIA 的首个全面综述,分析了按模型类型、对抗知识和策略进行的攻击。与以往综述不同,我们进一步检视了 MIA 在模型管道的多个阶段的应用,包括预训练、微调、对齐以及检索增强生成 (Retrieval-Augmented Generation, RAG)。最后,我们确定了开放挑战,提出了未来研究方向,以增强大规模模型的隐私韧性。

关键词

引用

@article{arxiv.2503.19338,
  title  = {Membership Inference Attacks on Large-Scale Models: A Survey},
  author = {Hengyu Wu and Yang Cao},
  journal= {arXiv preprint arXiv:2503.19338},
  year   = {2025}
}

备注

Preprint. Submitted for peer review. The final version may differ