公平性样本复杂度及人工干预的必要性
机器学习
2019-10-28 v1 计算机与社会
机器学习
摘要
为了构建符合公平与问责标准的机器学习系统,我们探讨了显式子群体样本复杂度下界。这项工作的动机源于如下观察:在按特定敏感变量子群划分时,真实世界数据集的分类器预测往往表现出截然不同的指标,例如准确率。造成这些差异的原因多种多样,不仅限于缓解变量的影响、制度性偏差、底层总体分布以及采样偏差。在众多现有的公平性定义中,我们认为,至少原则性的机器学习实践应确保分类预测能够反映底层子群体分布。然而,随着敏感变量数量的增加,处于这些变量交叉性上的群体可能根本不存在,或可能不足以提供用于分类的准确样本。在这些日益可能的情形下,我们主张进行人工干预并应用情境化与个体化的公平性定义。本文基于“可能近似度量公平学习”(Probably Approximately Metric Fair Learning)理论,给出了度量公平学习(metric-fair learning)的子群体样本复杂度下界。我们证明,要使分类器逼近关于特定敏感变量的公平性定义,必须有充足的子群体总体样本存在,且模型维度必须与子群体总体分布相对齐。在不可行的情况下,我们提出一种使用个体公平性定义来实现对齐的方法。我们以此视角考察了两个常用的 UCI 数据集,并建议针对特定子群体进行数据收集的人工干预,以对线性假设实现近似个体公平性。
引用
@article{arxiv.1910.11452,
title = {Fairness Sample Complexity and the Case for Human Intervention},
author = {Ananth Balashankar and Alyssa Lees},
journal= {arXiv preprint arXiv:1910.11452},
year = {2019}
}
备注
Where is the Human? Bridging the Gap Between AI and HCI, CHI Workshop 2019