中文

双目的训练:通过双用途标记缓解大语言模型中的成员推断攻击

机器学习 2025-06-03 v2 计算与语言

摘要

大语言模型(LLM)已成为现代自然语言处理的基石,但存在泄露敏感训练数据的隐私担忧。成员推断攻击(MIAs)旨在推断样本是否包含在模型的训练数据集中,可作为更广泛隐私威胁的基础。旨在针对传统分类模型设计的现有防御措施未能考虑文本数据的序列性质。结果要么需要显著的计算资源,要么无法有效缓解 LLM 中的隐私风险。在本工作中,我们提出了一种方法,利用基于标记的特征来保护语言模型训练数据的轻量且有效的经验隐私防御。通过分析训练期间的标记动态,我们提出了一种将标记分为用于学习的难标记和用于遗忘的已记忆标记的标记选择策略。随后,我们的训练阶段防御优化了一种新的双目的标记级损失,以实现实用性和隐私性之间的帕累托最优平衡。广泛的实验表明,我们的方法不仅提供了对 MIAs 的强有力保护,还在 various LLM 架构和数据集上实现了约 10% 的语言建模性能提升。

关键词

引用

@article{arxiv.2502.19726,
  title  = {Tokens for Learning, Tokens for Unlearning: Mitigating Membership Inference Attacks in Large Language Models via Dual-Purpose Training},
  author = {Toan Tran and Ruixuan Liu and Li Xiong},
  journal= {arXiv preprint arXiv:2502.19726},
  year   = {2025}
}

备注

ACL'25 (Findings)