EM-MIAs:通过集成建模提升大型语言模型中的成员推断攻击
机器人学
2024-12-24 v1 密码学与安全
摘要
随着大型语言模型 (LLM) 的广泛应用,关于模型训练数据隐私泄露的关注日益增加。成员推断攻击 (Membership Inference Attacks, MIAs) 已成为评估这些模型隐私风险的关键工具。尽管已存在的攻击方法(如 LOSS、Reference-based、min-k 和 zlib)在特定场景下表现良好,但在大型预训练语言模型上往往接近随机猜测,尤其在大规模数据集和单 epoch 训练的背景下效果尤为不佳。为此,本文提出一种新的集成攻击方法,将多个现有 MIAs 技术(LOSS、Reference-based、min-k、zlib)整合到基于 XGBoost 的模型中,以提升整体攻击性能 (EM-MIAs)。实验结果表明,集成模型在各种大型语言模型和数据集上相较于单个攻击方法在 AUC-ROC 和准确率方面显著提升。这表明通过结合不同方法的优势,我们能够更有效地识别模型训练数据的成员,从而为评估 LLM 隐私风险提供更稳健的工具。本研究为 LLM 隐私保护领域的进一步研究提供了新方向,并凸显了开发更强隐私审计方法的必要性。
引用
@article{arxiv.2412.17249,
title = {EM-MIAs: Enhancing Membership Inference Attacks in Large Language Models through Ensemble Modeling},
author = {Zichen Song and Sitan Huang and Zhongfeng Kang},
journal= {arXiv preprint arXiv:2412.17249},
year = {2024}
}
备注
Accepted by ICASSP 2025 Main