用于去偏神经网络的内部处理法
机器学习
2022-04-12 v2 机器学习
摘要
随着深度学习模型被赋予越来越多影响人类生活的决策任务,如刑事累犯、贷款偿还和面向执法的面部识别,偏差正成为日益关注的问题。去偏算法通常分为三种范式:预处理、处理中和后处理。然而,在计算机视觉或自然语言应用中,通常从大型通用模型起步,再微调至特定用例。预处理或处理中方法需从头重新训练整个模型,而后处理方法仅能黑盒访问模型,因此无法利用已训练模型的权重。专门针对此微调用例的去偏算法在很大程度上被忽视。本工作中,我们开启去偏研究中一种新范式——内部处理(intra-processing)的研究,它位于处理中与后处理方法之间。内部处理方法专门设计用于对在通用数据集上训练并已在更具体任务上微调的大型模型去偏。我们展示了如何将现有处理中方法改造用于此用例,并提出了三种基线算法:随机扰动、逐层优化和对抗微调。我们的所有技术均可用于所有流行的群体公平度量,如均等几率或统计奇偶差异。我们在 AIF360 工具包的三种流行数据集以及 CelebA 人脸数据集上评估了这些方法。我们的代码见 https://github.com/abacusai/intraprocessing_debiasing。
引用
@article{arxiv.2006.08564,
title = {Intra-Processing Methods for Debiasing Neural Networks},
author = {Yash Savani and Colin White and Naveen Sundar Govindarajulu},
journal= {arXiv preprint arXiv:2006.08564},
year = {2022}
}