中文

利用众包人口统计信息改善大规模物体识别中的公平性

计算机视觉与模式识别 2022-06-06 v1 计算机与社会 机器学习

摘要

机器学习中的伦理问题日益受到关注,公平性已成为一个重要研究课题。计算机视觉领域的大多数公平性工作集中在人体感知应用上,并通过增加特定人口群体的视觉表征来防止基于种族、肤色或年龄等人体物理属性的歧视。我们认为机器学习的公平性工作也应扩展到物体识别。建筑、艺术品、食物和服装是定义人类文化的物体示例。在机器学习数据集中公平地表示这些物体,将产生对特定文化偏见更小、对不同传统与价值观更具包容性的模型。现有许多物体识别研究数据集,但并未仔细考虑应包含哪些类别,或每个类别应收集多少训练数据。为此,我们提出一种简单而通用的基于众包贡献者人口统计构成的方法:定义公平相关性分数,估计并将其分配给每个类别。我们展示了其在地标识别领域的应用,给出详细分析以及最终更公平的地标排序。我们分析表明,与现有数据集相比,该方法实现了对世界更公平的覆盖。该评估数据集用于2021年Google地标挑战赛,这是首个强调通用物体识别中公平性的同类挑战赛。

关键词

引用

@article{arxiv.2206.01326,
  title  = {Improving Fairness in Large-Scale Object Recognition by CrowdSourced Demographic Information},
  author = {Zu Kim and André Araujo and Bingyi Cao and Cam Askew and Jack Sim and Mike Green and N'Mah Fodiatu Yilla and Tobias Weyand},
  journal= {arXiv preprint arXiv:2206.01326},
  year   = {2022}
}