中文

FusionDP:面向部分敏感特征的基于基础模型的差分隐私学习

机器学习 2025-11-07 v1

摘要

确保敏感训练数据的隐私是隐私保护机器学习中至关重要的环节。然而,在实际场景中,仅需对特征子集实施隐私保护。例如,在 ICU 数据中,年龄和性别等人口统计属性因其重识别潜力而构成更高的隐私风险,而原始实验室结果则通常不那么敏感。传统的 DP-SGD 对每个样本中的所有特征强制实施隐私保护,导致噪声注入过度且显著降低实用性。我们提出 FusionDP,一个两步骤框架,在特征级差分隐私下提升模型实用性。首先,FusionDP 利用大型基础模型对给定非敏感特征的敏感特征进行插值,将其作为外部先验,提供对敏感属性高质量估计,而无需在模型训练期间访问真实值。其次,我们引入修改版 DP-SGD算法,在原始和插值特征上训练模型,同时正式保护原始敏感特征的隐私。我们在两个模态上评估 FusionDP:一个来自 PhysioNet 的脓毒症预测任务和一个来自 MIMIC-III 的临床笔记分类任务。与隐私保护基线方法相比,我们的结果显示 FusionDP 在保持严格特征级隐私的同时显著提升了模型性能,证明了基础模型驱动的插值在提高各种模态的隐私-实用性权衡方面的潜力。

关键词

引用

@article{arxiv.2511.03806,
  title  = {FusionDP: Foundation Model-Assisted Differentially Private Learning for Partially Sensitive Features},
  author = {Linghui Zeng and Ruixuan Liu and Atiquer Rahman Sarkar and Xiaoqian Jiang and Joyce C. Ho and Li Xiong},
  journal= {arXiv preprint arXiv:2511.03806},
  year   = {2025}
}