从希冀到安全:通过隐空间梯度惩罚使深度模型遗忘偏见
机器学习
2023-12-19 v3 人工智能
计算机视觉与模式识别
计算机与社会
摘要
深度神经网络易于学习训练数据中嵌入的虚假关联,从而导致潜在的偏见预测。在将这些模型部署于医疗等高风险决策场景时,这带来了风险。当前的事后模型校正方法要么需要输入级标注(仅对空间局部化偏见可行),要么增强隐特征空间,从而寄望于强制正确的推理依据。我们提出了一种在概念层面进行模型校正的新方法,通过梯度惩罚显式降低模型对偏见的敏感度。当使用概念激活向量(Concept Activation Vectors)对偏见建模时,我们强调了选择鲁棒方向的重要性,因为传统的基于回归的方法(如支持向量机)往往导致发散方向。我们利用 VGG、ResNet 和 EfficientNet 架构,在 ISIC、Bone Age、ImageNet 和 CelebA 数据集的有控与真实世界设定下有效缓解了偏见。代码见 https://github.com/frederikpahde/rrclarc。
引用
@article{arxiv.2308.09437,
title = {From Hope to Safety: Unlearning Biases of Deep Models via Gradient Penalization in Latent Space},
author = {Maximilian Dreyer and Frederik Pahde and Christopher J. Anders and Wojciech Samek and Sebastian Lapuschkin},
journal= {arXiv preprint arXiv:2308.09437},
year = {2023}
}
备注
35 pages (9 pages manuscript, 2 pages references, 24 pages appendix)