中文

FACET:计算机视觉公平性评估基准

计算机视觉与模式识别 2023-09-04 v1 人工智能

摘要

计算机视觉模型在性别、肤色等属性上已知存在性能差异。这意味着在分类与检测等任务中,模型性能会因图像中人物的 demographics 而针对不同类别有所不同。这些差异已被证实存在,但迄今尚无统一方法来衡量计算机视觉模型常见用例中的此类差异。我们提出一个名为 FACET(FAirness in Computer Vision EvaluaTion,计算机视觉评估公平性)的新基准,这是一个大规模、公开可用的评估集,包含 32k 图像,涵盖部分最常见的视觉任务——图像分类、目标检测与分割。对于 FACET 中的每张图像,我们聘请专家标注员手动标注人物相关属性(如感知肤色与发质),手动绘制边界框并标注细粒度人物相关类别(如唱片骑师或吉他手)。此外,我们使用 FACET 对最先进的视觉模型进行基准测试,并深入理解跨敏感人口属性的潜在性能差异与挑战。利用收集的全面标注,我们采用单一人口属性以及交叉方法下的多重属性(如发色与感知肤色)探查模型。我们的结果表明,分类、检测、分割与视觉定位模型在人口属性及属性交叉上均表现出性能差异。这些危害表明,数据集中并非所有人物在这些视觉任务中都获得公平与公正的对待。我们希望使用本基准的当前与未来结果将有助于更公平、更鲁棒的视觉模型。FACET 公开于 https://facet.metademolab.com/。

关键词

引用

@article{arxiv.2309.00035,
  title  = {FACET: Fairness in Computer Vision Evaluation Benchmark},
  author = {Laura Gustafson and Chloe Rolland and Nikhila Ravi and Quentin Duval and Aaron Adcock and Cheng-Yang Fu and Melissa Hall and Candace Ross},
  journal= {arXiv preprint arXiv:2309.00035},
  year   = {2023}
}