过学习暴露敏感属性
机器学习
2020-02-11 v3 神经与进化计算
机器学习
摘要
“过学习”指为看似简单目标训练的模型隐式地学会识别(1)不属于学习目标且(2)从隐私或偏见角度看为敏感的属性和概念。例如,人脸图像的二值性别分类器也学会识别种族——甚至是训练数据中未表示的种族——和身份。我们在若干视觉与 NLP 模型中演示过学习并分析其有害后果。首先,过学习模型的推理时表示暴露输入的敏感属性,打破如模型分割等隐私保护。其次,即便缺乏原始训练数据,过学习模型也可被“改作”用于不同的、侵犯隐私的任务。我们展示过学习对某些任务而言是内在的,无法通过审查不想要的属性来防止。最后,我们探究过学习在模型训练期间何处、何时及为何发生。
引用
@article{arxiv.1905.11742,
title = {Overlearning Reveals Sensitive Attributes},
author = {Congzheng Song and Vitaly Shmatikov},
journal= {arXiv preprint arXiv:1905.11742},
year = {2020}
}