中文

合成数据可能误导评估:作为机器文本检测的成员推断

计算与语言 2025-01-22 v1 密码学与安全 机器学习

摘要

近期研究表明,针对大语言模型(LLMs)的成员推断攻击(MIAs)会产生不确定的结果,部分原因在于难以在不存在时间偏移的情况下构建非成员数据集。尽管研究人员已转向使用合成数据作为替代方案,我们证明这种方法从根本上就具有误导性。我们的实验表明,MIAs 实质上充当了机器生成文本检测器,无论数据来源如何,都会将合成数据错误地识别为训练样本。这种行为在不同模型架构和规模下持续存在,从开源模型到 GPT-3.5 等商业模型均是如此。即使是由不同(可能更大的)模型生成的合成文本,也会被目标模型归类为训练数据。我们的研究结果凸显了一个严重问题:在成员评估中使用合成数据可能导致关于模型记忆和数据泄露的错误结论。我们警示,这一问题可能影响其他使用模型信号(如损失)的评估,其中合成或机器生成的翻译数据被用于替代真实样本。

关键词

引用

@article{arxiv.2501.11786,
  title  = {Synthetic Data Can Mislead Evaluations: Membership Inference as Machine Text Detection},
  author = {Ali Naseh and Niloofar Mireshghallah},
  journal= {arXiv preprint arXiv:2501.11786},
  year   = {2025}
}