中文

基于人类审计员对黑盒分类器的二值反馈学习与施行潜在评估模型

人机交互 2022-02-17 v1 机器学习

摘要

算法公平文献提出了众多数学概念与度量,并指出在同时满足其中部分或全部时存在权衡。此外,公平性概念的上文相关性使得在多样化算法系统中自动化偏倚评估十分困难。因此,本文提出一种称为潜在评估模型(LAM)的新模型,通过假设审计员将分类器输出与自身对每一输入的固有判断进行比较来刻画人类审计员提供的二值反馈。我们证明,只要审计员的固有判断本身满足所涉公平概念且与分类器评估相对相似,个体与群体公平概念即得到保证。我们还在三个知名数据集(即 COMPAS、German credit 与 Adult Census Income 数据集)上展示了 LAM 与传统公平概念之间的这一关系。此外,我们还推导了获得 PAC 学习保证以估计黑盒分类器 LAM 所需的最小反馈样本数。这些保证也通过对 400 名人类审计员就 COMPAS 提供的真实二值反馈训练标准机器学习算法得到验证。

关键词

引用

@article{arxiv.2202.08250,
  title  = {On Learning and Enforcing Latent Assessment Models using Binary Feedback from Human Auditors Regarding Black-Box Classifiers},
  author = {Mukund Telukunta and Venkata Sriram Siddhardh Nadendla},
  journal= {arXiv preprint arXiv:2202.08250},
  year   = {2022}
}

备注

Submitted to ACM FAccT 22. arXiv admin note: text overlap with arXiv:2107.01277