场景识别中的数字鸿沟:揭示深度学习系统中的社会经济偏见
计算机视觉与模式识别
2025-03-07 v2 人工智能
摘要
基于计算机的场景理解已影响从城市规划到自动驾驶汽车性能等多个领域,但人们对这些技术在不同社会差异下的表现知之甚少。我们利用来自全球和美国来源的近百万张图像(包括用户提交的家庭照片和Airbnb房源),研究了深度卷积神经网络(dCNNs)在场景分类中的偏见。我们应用统计模型,量化了来自公共数据源(CIA和美国人口普查)的社会经济指标,如家庭收入、人类发展指数(HDI)和人口统计因素,对dCNN性能的影响。我们的分析揭示了显著的社会经济偏见,预训练的dCNN在应用于社会经济地位(SES)较低的家庭图像时,表现出更低的分类准确率、更低的分类置信度,以及更高的倾向去分配那些可能具有冒犯性的标签(例如,“废墟”、“贫民窟”)。这一趋势在两个国际图像数据集以及美国内部多样化的经济和种族景观中都是一致的。这项研究有助于理解计算机视觉中的偏见,强调了需要更具包容性和代表性的训练数据集。通过减轻计算机视觉流程中的偏见,我们可以确保应用计算机视觉(包括房屋估值和智能家居安全系统)获得更公平、更公正的结果。解决这些偏见具有紧迫性,因为它们会显著影响城市发展和资源分配中的关键决策。我们的发现也推动了能更好理解并服务于多样化社区的AI系统的发展,朝着技术公平惠及社会所有部门的方向迈进。
引用
@article{arxiv.2401.13097,
title = {Digital Divides in Scene Recognition: Uncovering Socioeconomic Biases in Deep Learning Systems},
author = {Michelle R. Greene and Mariam Josyula and Wentao Si and Jennifer A. Hart},
journal= {arXiv preprint arXiv:2401.13097},
year = {2025}
}
备注
28 pages, 3 figures, 6 tables