中文

通过图像描述实现的差分隐私表征学习

计算机视觉与模式识别 2024-10-31 v2 机器学习

摘要

差分隐私机器学习被视为在保留隐私的同时训练模型的金标准解决方案,但其主要障碍之一是隐私-精度权衡的次优表现,尤其在差分隐私表征学习中尤为明显。具体而言,已证明在适度的隐私预算下,大多数模型学习到的表征不如手工特征。本文我们表明,通过图像描述和扩展至互联网规模的多模态数据集,可实现有效的差分隐私表征学习。通过一系列工程技巧,我们成功地在计算量合理的情况下,使用合理的计算资源从头开始在2330万数据子集上训练了DP图像描述器(DP-Cap),并获得了前所未有的高质量图像特征,可用于多种下游视觉和视觉语言任务。例如,在LAION数据集的隐私预算为varepsilon=8\\varepsilon=8时,训练在学习到的DP-Cap特征上的数据线性分类器在ImageNet-1K上取得65.865.8\\%的准确率,显著优于之前的SOTA的56.556.5\\%

关键词

引用

@article{arxiv.2403.02506,
  title  = {Differentially Private Representation Learning via Image Captioning},
  author = {Tom Sander and Yaodong Yu and Maziar Sanjabi and Alain Durmus and Yi Ma and Kamalika Chaudhuri and Chuan Guo},
  journal= {arXiv preprint arXiv:2403.02506},
  year   = {2024}
}

备注

Accepted and presented at ICML 2024