中文

迈向机器学习中的交叉性:纳入更多身份、处理代表性不足与执行评估

机器学习 2022-05-11 v1 计算机与社会

摘要

机器学习公平性研究历来只考虑单一二元人口属性;然而,现实当然要复杂得多。本工作中,我们探讨了在将交叉性作为多个人口属性纳入机器学习流水线三个阶段时所出现的问题:(1)将哪些人口属性作为数据集标签纳入,(2)在模型训练期间如何处理逐级变小的子群规模,以及(3)在对更多子群进行模型公平性基准测试时如何超越现有评估指标。针对每个问题,我们在源自美国人口普查的表格数据集上提供了详尽的实证评估,并为机器学习界提出了建设性建议。首先,我们主张在选择训练所用人口属性标签时以经验验证补充领域知识,同时始终在完整人口属性集上评估。其次,我们警示勿在不考虑其规范性含义的情况下使用数据不平衡技术,并建议一种利用数据结构的替代方案。第三,我们引入了更适用于交叉性设置的新评估指标。总体而言,我们就将交叉性纳入机器学习时三个必要(虽不充分!)的考量提供了实质性建议。

关键词

引用

@article{arxiv.2205.04610,
  title  = {Towards Intersectionality in Machine Learning: Including More Identities, Handling Underrepresentation, and Performing Evaluation},
  author = {Angelina Wang and Vikram V. Ramaswamy and Olga Russakovsky},
  journal= {arXiv preprint arXiv:2205.04610},
  year   = {2022}
}

备注

ACM Conference on Fairness, Accountability, and Transparency (FAccT) 2022