中文

数据集中歧视的事前评估

机器学习 2022-08-19 v2 计算机与社会

摘要

数据所有者因其数据使用可能损害弱势社区而面临日益增长的责任。利益相关者希望识别导致算法对特定人口群体(例如由种族、性别、年龄和/或宗教定义)产生偏见的数据特征。具体而言,我们感兴趣的是识别特征空间中真实响应函数(从特征到观测结果)在不同人口群体间存在差异的子集。为此,我们提出FORESEE,一种决策树森林(FORESt of decision trEEs)算法,其生成捕捉个体响应随敏感属性变化可能性的分数。经验上,我们发现我们的方法使我们能够识别最可能被若干分类器(包括随机森林、逻辑回归、支持向量机和k近邻)误分类的个体。我们方法的优势在于它使利益相关者能够刻画可能导致歧视的风险样本,并使用FORESEE估计即将到来样本的风险。

关键词

引用

@article{arxiv.2208.07918,
  title  = {Ex-Ante Assessment of Discrimination in Dataset},
  author = {Jonathan Vasquez and Xavier Gitiaux and Huzefa Rangwala},
  journal= {arXiv preprint arXiv:2208.07918},
  year   = {2022}
}