离散扩散语言模型的成员推断攻击
机器学习
2026-05-20 v2 人工智能
摘要
掩码扩散语言模型(MDLMs)用迭代去掩码代替自回归生成,其隐私属性尚未得到广泛研究。我们研究了在微调MDLMs上进行的成员推断攻击(MIA),并显示其比当前灰盒基准更易受到攻击。我们从模型在四个掩码比例下的重构损失中提取出46维特征向量,并在其上训练XGBoost和MLP分类器。在MIMIR基准的六个文本领域中,XGBoost实现的平均AUC为0.878,在Pile CC上最高可达0.930,平均比SAMA灰盒基准高出0.062的AUC。一次信号留检验显示,ELBO轨迹alone驱动了大部分攻击效果,移除后平均下降0.130,而注意力特征的贡献几乎为零,低于0.003。我们还设计了一种影子模型迁移攻击,其中K=3个在无关领域数据上训练的替代MDLMs生成分类器标签,无需访问目标领域数据。该方法在平均AUC为0.858,仅低于白盒oracle 0.020,证明了影子模型迁移是一种实用且近乎等效的攻击路径。
引用
@article{arxiv.2605.16445,
title = {Membership Inference Attacks on Discrete Diffusion Language Models},
author = {Shailesh Kasivelrajan},
journal= {arXiv preprint arXiv:2605.16445},
year = {2026}
}
备注
Citations and Co Authors need to be verified and updated. Will submit a new version soon