中文

数据偏置下公平分类器的比较研究

机器学习 2023-12-12 v2 人工智能

摘要

在本文中,我们考虑一种用于注入数据偏置的理论模型,即欠表示(under-representation)与标签偏置(label bias)(Blum & Stangl, 2019)。我们实证研究了不同数据偏置对公平分类器准确性与公平性的影响。通过在合成与真实世界数据集(如 Adult、German Credit、Bank Marketing、COMPAS)上的大量实验,我们向标准公平性工具包中的前处理、中处理与后处理公平分类器的训练数据(而非测试数据)注入不同程度的欠表示与标签偏置,从而对其公平性与准确性进行实证审计。我们的主要观察如下:1. 许多标准公平分类器的公平性与准确性随着训练数据中注入偏置的增加而严重退化;2. 在正确数据上训练的简单逻辑回归模型,在准确性与公平性上往往优于在偏置训练数据上训练的大多数公平分类器;3. 少数简单的公平性技术(如重加权、指数梯度)即使在训练数据被注入欠表示与标签偏置时,似乎也能提供稳定的准确性与公平性保证。我们的实验还展示了如何将一种数据偏置风险的度量整合进现有公平性仪表盘以用于真实世界部署。

关键词

引用

@article{arxiv.2302.05906,
  title  = {On Comparing Fair Classifiers under Data Bias},
  author = {Mohit Sharma and Amit Deshpande and Rajiv Ratn Shah},
  journal= {arXiv preprint arXiv:2302.05906},
  year   = {2023}
}

备注

Accepted as a Spotlight Presentation at Algorithmic Fairness through the Lens of Time, Neurips 2023 Workshop