中文

基于表征梯度解释的模型去偏

机器学习 2023-09-06 v2 计算机与社会

摘要

机器学习系统会对某些人口群体产生偏倚结果,即所谓的公平性问题。近期解决该问题的方法通过解耦表征学习习得一个潜码(即表征),然后丢弃与敏感属性(如性别)相关的潜码维度。然而,这些方法在处理真实世界数据(尤其非结构化数据)时,可能受限于不完全解耦并忽略代理属性(敏感属性的代理),导致公平性和下游任务有用信息的损失。本文提出一种新颖的公平框架,针对敏感属性和代理属性均进行去偏,从而在不完全解耦的情况下提升下游任务模型的预测性能。其主要思想是:首先利用基于梯度的解释找出两个模型关注点,1)一个用于预测敏感属性,2)另一个用于预测下游任务标签;其次,利用它们扰动潜码,以引导下游任务模型训练朝向公平性与效用目标。我们通过实验表明,我们的框架既适用于解耦也适用于非解耦表征学习方法,并在非结构化与结构化数据集上比先前最先进的方法取得了更好的公平性-准确性权衡。

关键词

引用

@article{arxiv.2305.12178,
  title  = {Model Debiasing via Gradient-based Explanation on Representation},
  author = {Jindi Zhang and Luning Wang and Dan Su and Yongxiang Huang and Caleb Chen Cao and Lei Chen},
  journal= {arXiv preprint arXiv:2305.12178},
  year   = {2023}
}