论不公平之因:从训练样本视角出发
机器学习
2024-02-20 v2 人工智能
计算机与社会
摘要
识别模型不公平性的成因是一项重要却相对未被充分探索的任务。我们通过训练数据这一不公平的主要来源来审视该问题。我们提出如下问题:若模型的训练样本(1)采集自不同(如人口统计)群体、(2)标签不同、或(3)其特征被修改,模型的不公平性将如何变化?换言之,我们基于预定义概念(即数据属性,如特征、标签和敏感属性)对样本进行反事实改变,从而量化训练样本对不公平性的影响。我们的框架不仅可帮助实践者理解观测到的不公平性并通过修复训练数据来缓解它,还带来了许多其他应用,例如检测错误标注、修正不平衡表征,以及检测针对公平性的投毒攻击。
引用
@article{arxiv.2306.17828,
title = {On the Cause of Unfairness: A Training Sample Perspective},
author = {Yuanshun Yao and Yang Liu},
journal= {arXiv preprint arXiv:2306.17828},
year = {2024}
}