中文

面向多标签图像分类器中人口统计差异的可靠评估

计算机视觉与模式识别 2023-02-20 v1 人机交互 社会与信息网络

摘要

跨人口统计群体的细分性能度量是计算机视觉中公平性评估的标志。这些度量成功激励了以人为中心任务(如人脸分析)上的性能改进,并被用于理解现代模型的风险。然而,对于更复杂的计算机视觉任务,这些度量的脆弱性缺乏讨论。在本文中,我们考虑多标签图像分类,具体而言是物体分类任务。首先,我们强调了测量中涉及的设计选择与权衡,其微妙程度超出先前计算机视觉文献中的讨论。这些挑战涉及必要的数据规模、图像群体定义、度量选择以及数据集不平衡。接着,通过使用现代视觉模型的两个案例研究,我们证明了这些评估的朴素实现是脆弱的。我们识别出若干看似仅是实现细节却显著影响评估结论(就差异的大小与方向——即分类器在哪一群体上表现最佳——而言)的设计选择。基于消融研究,我们提出了一些提升这些评估可靠性的建议。最后,通过定性分析我们发现,具有较大差异的概念往往在群体间存在不同的定义与表征,且跨数据集与标注者间存在不一致。尽管该结果提示可通过更一致的数据收集来缓解,但也凸显出在执行模型评估时模糊的标签定义仍是一项挑战。视觉模型正在扩展并变得愈发 ubiquitous;我们的差异评估准确反映模型真实性能变得更为重要。

关键词

引用

@article{arxiv.2302.08572,
  title  = {Towards Reliable Assessments of Demographic Disparities in Multi-Label Image Classifiers},
  author = {Melissa Hall and Bobbie Chern and Laura Gustafson and Denisse Ventura and Harshad Kulkarni and Candace Ross and Nicolas Usunier},
  journal= {arXiv preprint arXiv:2302.08572},
  year   = {2023}
}