中文

更多数据可能误导我们:标签偏差下的主动数据获取

机器学习 2023-07-11 v1 计算机与社会

摘要

对算法偏差风险认识的增强推动了围绕偏差缓解策略的大量努力。绝大多数提出的方法属于以下两类之一:(1) 在预测模型上施加算法公平约束,以及 (2) 收集额外的训练样本。最近,处于这两类交叉点的方法——即在公平约束下提出主动学习的方法——已被开发出来。然而,提出的偏差缓解策略通常忽视了观测标签中存在的偏差。在这项工作中,我们研究了在标签偏差存在的情况下主动数据收集策略的公平性考量。我们首先在监督学习系统的背景下概述不同类型的标签偏差。然后我们通过实证表明,当忽视标签偏差时,收集更多数据会加剧偏差,并且在数据收集过程中施加依赖观测标签的公平约束可能无法解决问题。我们的结果说明了部署试图缓解单一类型偏差而忽视其他偏差的模型所带来的意外后果,强调了明确区分公平感知算法旨在解决的偏差类型的重要性,并凸显了在数据收集期间忽视标签偏差的风险。

关键词

引用

@article{arxiv.2207.07723,
  title  = {More Data Can Lead Us Astray: Active Data Acquisition in the Presence of Label Bias},
  author = {Yunyi Li and Maria De-Arteaga and Maytal Saar-Tsechansky},
  journal= {arXiv preprint arXiv:2207.07723},
  year   = {2023}
}