中文

演示 Rosa:面向任意数据分析流水线的公平性解决方案

机器学习 2021-03-08 v2 应用统计

摘要

分析行业关注的大多数数据集都受到各种形式人类偏见的影响。因此,在此类数据上开展的数据分析[DA]或机器学习[ML]的结果容易复制这些偏见。结果,近期大量基于 DA/ML 的偏见决策系统引起了关注。本文我们介绍 Rosa,一个免费的、基于 Web 的工具,用于针对所选特征轻松地对数据集去偏。Rosa 基于 illumr 公司开发的公平对抗网络(Fair Adversarial Networks)原理,因此能够去除交互式、非线性和非二元的偏见。Rosa 是独立的预处理步骤/API,意味着它可轻松用于任何 DA/ML 流水线。我们通过在对五个真实世界数据集(因其与当前 DA 问题的相关性及高偏见潜力而被选中)执行标准 DA 任务,测试 Rosa 在从数据驱动决策系统中去除偏见的有效性。我们使用简单 ML 模型对分析关注的特征建模,并比较以 Rosa 为预处理步骤与否时模型输出中的偏见水平。我们发现,在所有案例中,当数据经 Rosa 预处理后,数据驱动决策系统的偏见均大幅降低。

关键词

引用

@article{arxiv.2003.00899,
  title  = {Demonstrating Rosa: the fairness solution for any Data Analytic pipeline},
  author = {Kate Wilkinson and George Cevora},
  journal= {arXiv preprint arXiv:2003.00899},
  year   = {2021}
}

备注

corrected typo in fig 8 caption