中文

我的文本在你的 AI 模型中吗?应用于 LLM 的基于梯度的成员推断测试

计算与语言 2025-03-14 v2 人工智能

摘要

本工作将基于梯度的成员推断测试(gMINT)适配并研究于基于 LLM 的文本分类。MINT 是一种通用方法,旨在确定给定数据是否被用于训练机器学习模型,本工作重点关注其在自然语言处理领域的应用。通过基于梯度的分析,MINT 模型可识别特定数据样本是否在语言模型训练阶段被包含,从而应对机器学习中日益增长的数据隐私担忧。该方法在七个 Transformer 模型和包含超过 250 万个句子的六个数据集上进行了评估,重点关注文本分类任务。实验结果证明了 MINT 的鲁棒性,根据数据规模和模型架构的不同,取得了 85% 到 99% 的 AUC 分数。这些发现凸显了 MINT 作为可扩展且可靠的工具在审计机器学习模型方面的潜力,有助于确保透明度、保护敏感数据并促进 AI/NLP 技术部署中的伦理合规。

关键词

引用

@article{arxiv.2503.07384,
  title  = {Is My Text in Your AI Model? Gradient-based Membership Inference Test applied to LLMs},
  author = {Gonzalo Mancera and Daniel DeAlcala and Julian Fierrez and Ruben Tolosana and Aythami Morales},
  journal= {arXiv preprint arXiv:2503.07384},
  year   = {2025}
}