面向微调扩散语言模型的成员推断攻击
机器学习
2026-02-10 v3 人工智能
摘要
扩散语言模型(Diffusion Language Models, DLMs)代表了一种引言自回归语言模型的有前景的替代方案,采用双向掩码标记预测。然而,其通过成员推断攻击(Membership Inference Attacks, MIA)导致的隐私泄露风险仍处于严重未被充分探讨的状态。本文 presents 对 DLMs 中 MIA 漏洞的首次系统性调查。不同于引言自回归模型的单一固定预测模式,DLMs 的多种可掩码配置指数级地增加了攻击机会。这一通过对多个独立掩码进行探测的能力显著提升了检测概率。为充分利用这一优势,我们引入了 SAMA(Subset-Aggregated Membership Attack),通过稳健聚合来解决稀疏信号挑战。SAMA 对不同密度的掩码子集进行采样,并应用基于符号的统计方法,该方法即使在重尾噪声下也保持有效。通过反加权聚合优先考虑稀疏掩码的更干净信号,SAMA 将稀疏记忆检测转化为稳健的投票机制。实验在九个数据集上表明,SAMA 相比最佳基线实现了 30% 的相对 AUC 提升,在低假阳性率下提升幅度可达 8 倍。这些发现揭示了 DLMs 中显著且此前未知的漏洞,迫切需要开发针对性隐私防御机制。
引用
@article{arxiv.2601.20125,
title = {Membership Inference Attacks Against Fine-tuned Diffusion Language Models},
author = {Yuetian Chen and Kaiyuan Zhang and Yuntao Du and Edoardo Stoppa and Charles Fleming and Ashish Kundu and Bruno Ribeiro and Ninghui Li},
journal= {arXiv preprint arXiv:2601.20125},
year = {2026}
}
备注
Published as a conference paper at ICLR 2026