生成式文本分类器建模P(X)的隐性成本:对成员推断攻击的脆弱性
密码学与安全
2025-10-21 v1 计算与语言
机器学习
机器学习
摘要
成员推断攻击(MIA)通过使对抗者能够确定特定样本是否包含在模型训练数据集中来构成严重的隐私威胁。尽管针对MIA的研究已有所深入,但针对生成式与判别式分类器的系统性比较仍有限。本工作通过提供生成式分类器为何更易受到MIA威胁的理论动机,填补了这一空白,其后通过全面的实证评估来验证这些见解。我们的研究涵盖判别式、生成式和伪生成式文本分类器,涉及不同训练数据量,在九个基准数据集上进行评估。采用多样化的MIA策略,我们一致表明,显式建模联合似然的完全生成式分类器最易发生成员泄露。此外,我们观察到,生成式分类器中常用的标准推断方法会显著放大这种隐私风险。这些发现揭示了分类器设计中固有的效用-隐私权衡,凸显了在部署面向隐私敏感应用的生成式分类器时必须谨慎的必要性。我们的结果激励了未来在开发能够保持效用同时减缓成员推断漏洞的隐私保护生成式分类器方面的研究。
引用
@article{arxiv.2510.16122,
title = {The Hidden Cost of Modeling P(X): Vulnerability to Membership Inference Attacks in Generative Text Classifiers},
author = {Owais Makroo and Siva Rajesh Kasa and Sumegh Roychowdhury and Karan Gupta and Nikhil Pattisapu and Santhosh Kasa and Sumit Negi},
journal= {arXiv preprint arXiv:2510.16122},
year = {2025}
}