从图像分类神经网络梯度理解训练数据泄露
机器学习
2021-11-22 v1 机器学习
摘要
用于监督任务(例如图像分类与分割)的深度学习模型的联邦学习已找到诸多应用:例如在电影后期制作等人机协同任务中,它以高效且有效的方式实现了人类艺术家领域专业知识的共享。在此类许多应用中,由于知识产权或隐私考量,我们需要保护训练数据在训练过程中共享梯度时不被泄露。近期工作已表明,当图像分类模型架构已知时,有可能从其梯度重建训练数据。然而,对于此类攻击的成效与失效仍缺乏完整的理论理解。本文中,我们分析训练数据从梯度泄露的源头。我们将训练数据重建问题表述为逐层迭代求解一个优化问题。逐层目标函数主要由当前层的权重与梯度以及后续层重建的输出定义,但也可能涉及来自前一层的“回拉”约束。当我们从网络输出向后逐层求解该问题时,训练数据可被重建。基于该表述,我们能够将深度网络中训练数据的潜在泄露归因于其架构。我们还提出一种度量标准,用以衡量深度学习模型抵御针对训练数据的基于梯度攻击的安全水平。
引用
@article{arxiv.2111.10178,
title = {Understanding Training-Data Leakage from Gradients in Neural Networks for Image Classification},
author = {Cangxiong Chen and Neill D. F. Campbell},
journal= {arXiv preprint arXiv:2111.10178},
year = {2021}
}