面向含噪标签深度学习的私有半监督知识迁移
机器学习
2022-11-04 v1 密码学与安全
摘要
在大规模数据上训练的深度学习模型已在许多真实世界任务中取得令人鼓舞的性能。同时,发布那些在敏感数据集(如医疗记录)上训练的模型可能引发严重的隐私问题。为应对这些问题,当前最优方法之一是教师集成私有聚合(PATE),其在保持模型效用的同时提供了强隐私保证。PATE结合一组在敏感数据上训练的“教师模型”,并通过教师对未标记公共数据投票的加噪聚合将知识迁移至“学生”模型,学生模型将在这些公共数据上训练。然而,由于私有聚合,学生学到的知识或投票标签是有噪的。直接从含噪标签学习会显著影响学生模型的准确率。本文中,我们提出PATE++机制,将当前先进的含噪标签训练机制与原PATE框架结合以提升其准确率。为有效整合二者,我们设计了一种生成对抗网络(GANs)的新结构。此外,我们开发了一种用于半监督模型训练的含噪标签检测新机制,以在含噪标签训练时进一步提升学生模型性能。我们在Fashion-MNIST和SVHN上评估了我们的方法,显示了其在各项指标上相对原PATE的改进。
引用
@article{arxiv.2211.01628,
title = {Private Semi-supervised Knowledge Transfer for Deep Learning from Noisy Labels},
author = {Qiuchen Zhang and Jing Ma and Jian Lou and Li Xiong and Xiaoqian Jiang},
journal= {arXiv preprint arXiv:2211.01628},
year = {2022}
}