DELTA:面向隐私保护数据重编程的变分解缔学习
机器学习
2025-09-03 v1 人工智能
摘要
在实际应用中,领域数据常包含可识别或敏感属性,受严格监管(如 HIPAA、GDPR)约束,需要对数据特征进行显式工程以实现可解释性和透明性。现有特征工程主要致力于提升下游任务性能,往往风险隐私泄露。我们在此基础上提出新的学习任务——隐私保护数据重编程(Privacy-Preserving Data Reprogramming,PPDR):给定数据集,将特征转换为最大化目标属性预测准确率的同时最小化敏感属性预测准确率。PPDR 对现有系统提出挑战:1)在大范围搜索空间中生成高效用特征转换,2)从以效用为导向的特征中解缔并消除敏感信息以降低隐私推理风险。为此,我们提出 DELTA 框架,采用两阶段变分解缔生成式学习。阶段 I 使用基于策略的强化学习发现具有下游任务效用的特征转换,完全不考虑隐私可推理性。阶段 II 采用变分 LSTM 序列到序列编码器-解码器,构建效用-隐私解缔潜在空间设计,并引入对抗-因果解缔正则化,以抑制特征生成中的隐私信号。在八个数据集上实验表明,DELTA 提升预测性能约 9.3%,降低隐私泄露约 35%,显示出稳健且注重隐私的数据转换能力。
引用
@article{arxiv.2509.00693,
title = {DELTA: Variational Disentangled Learning for Privacy-Preserving Data Reprogramming},
author = {Arun Vignesh Malarkkan and Haoyue Bai and Anjali Kaushik and Yanjie Fu},
journal= {arXiv preprint arXiv:2509.00693},
year = {2025}
}
备注
10 pages, 5 figures, 3 Tables. Accepted at IEEE International Conference on Data Mining (ICDM) 2025