一种发现生成与预测模型中记忆现象的新型成员推理攻击:基于损失与参考模型的算法 (LBRM)
机器学习
2025-05-07 v1 人工智能
摘要
生成模型可能无意中记忆训练数据,带来显著的隐私风险。本文针对时间序列插补模型中的记忆现象,引入了基于损失与参考模型的算法 (LBRM)。LBRM方法利用参考模型来提高成员推理攻击的准确性,从而区分训练数据和测试数据。我们的贡献有两方面:首先,我们提出了一种创新方法来有效提取和识别被记忆的训练数据,显著提高了检测精度。平均而言,在不进行微调的情况下,AUROC提高了约40%。通过微调,AUROC提高了约60%。其次,我们通过对两种为时间序列插补设计的架构进行成员推理攻击来验证我们的方法,展示了LBRM方法在不同上下文中的鲁棒性和通用性。这些结果突显了LBRM方法在检测精度上的显著提升,解决了时间序列插补模型中的隐私风险。
引用
@article{arxiv.2505.03490,
title = {A new membership inference attack that spots memorization in generative and predictive models: Loss-Based with Reference Model algorithm (LBRM)},
author = {Faiz Taleb and Ivan Gazeau and Maryline Laurent},
journal= {arXiv preprint arXiv:2505.03490},
year = {2025}
}