通过期望最大化检测大型语言模型的训练数据
计算与语言
2026-01-27 v3 人工智能
密码学与安全
机器学习
摘要
成员推断攻击 (MIA) 旨在确定特定示例是否用于训练给定语言模型。虽然先前的工作探索了基于提示的攻击方法如 ReCALL,但这些方法高度依赖于使用已知非成员作为提示可可靠抑制模型对非成员查询的响应这一假设。我们提出了 EM-MIA,一种新的成员推断方法,通过迭代细化前缀有效性和成员得分使用期望最大化策略,而无需标记非成员示例。为支持受控评估,我们引入 OLMoMIA,一个基准,使我们能够在系统性变化的分布重叠和难度下分析 MIA 的鲁棒性。在 WikiMIA 和 OLMoMIA 上的实验表明,EM-MIA 在分布可分离性明显的设置下超越了现有基线方法,尤其在分布可分离性明显的设置下表现更佳。我们指出了 EM-MIA 在实际设置中具有部分分布重叠时成功的情景,而失败案例则暴露了当前 MIA 方法在接近相同条件下的根本性局限性。我们发布了代码和评估管道,以鼓励可重复且稳健的 MIA 研究。
引用
@article{arxiv.2410.07582,
title = {Detecting Training Data of Large Language Models via Expectation Maximization},
author = {Gyuwan Kim and Yang Li and Evangelia Spiliopoulou and Jie Ma and William Yang Wang},
journal= {arXiv preprint arXiv:2410.07582},
year = {2026}
}
备注
EACL 2026