解构成员推断:通过投毒否定成员推断
机器学习
2025-06-09 v1 密码学与安全
摘要
成员推断测试旨在确定特定数据点是否包含在语言模型的训练集中。然而,近期工作表明,这些测试在基于 exact matching 的成员定义下经常失败,建议放宽此定义以包括语义邻居作为成员。本 work 中我们表明,在这种放宽定义下,成员推断测试仍然不可靠——可以通过投毒方式导致测试对目标点产生错误预测。我们理论上揭示了测试准确率与对投毒鲁棒性之间的权衡。我们还提出了一种具体的投毒攻击实例并经验上验证了其有效性。我们的结果表明,它可以将现有测试的性能降至随机水平以下。
引用
@article{arxiv.2506.06003,
title = {What Really is a Member? Discrediting Membership Inference via Poisoning},
author = {Neal Mangaokar and Ashish Hooda and Zhuohang Li and Bradley A. Malin and Kassem Fawaz and Somesh Jha and Atul Prakash and Amrita Roy Chowdhury},
journal= {arXiv preprint arXiv:2506.06003},
year = {2025}
}