中文

公平感知的模型无关正例与无标记学习

机器学习 2022-06-22 v1 计算机与社会

摘要

随着机器学习在高风险决策问题中的应用日益增多,针对特定社会群体人群的潜在算法偏见对个人和整个社会都产生了负面影响。在现实场景中,许多此类问题涉及正例和无标记数据,例如医疗诊断、犯罪风险评估和推荐系统。例如,在医疗诊断中,只有确诊的疾病会被记录(正例),而其他则不会(无标记)。尽管在(半)监督和无监督设置下已有大量关于公平感知机器学习的工作,但在上述正例与无标记学习(PUL)情境中,公平性问题在很大程度上未被充分探索,且通常更为严重。本文为缓解这一矛盾,提出了一种名为FairPUL的公平感知PUL方法。特别地,对于来自两个群体的个体的二分类问题,我们旨在使两个群体达到相似的真正例率和假正例率,以此作为我们的公平性度量。基于对PUL最优公平分类器的分析,我们设计了一个模型无关的后处理框架,同时利用正例和无标记样本。我们的框架被证明在分类误差和公平性度量方面均是统计一致的。在合成数据集和真实世界数据集上的实验表明,我们的框架在PUL和公平分类两方面均优于现有最优方法。

关键词

引用

@article{arxiv.2206.09346,
  title  = {Fairness-aware Model-agnostic Positive and Unlabeled Learning},
  author = {Ziwei Wu and Jingrui He},
  journal= {arXiv preprint arXiv:2206.09346},
  year   = {2022}
}