弥合数字鸿沟:视觉-语言模型在社会经济因素上的性能差异
计算机与社会
2023-11-13 v1 人工智能
计算与语言
计算机视觉与模式识别
摘要
尽管当前AI模型在各任务上的性能表现令人瞩目,但性能报告往往未包含这些模型在将受该技术影响的特定群体上的评估。在AI中代表性不足的少数群体中,低收入家庭的数据常在数据收集和模型评估中被忽视。我们在一个包含不同收入值家庭图像(Dollar Street)的地理多样性数据集上评估了最先进的视觉-语言模型(CLIP)的性能,并表明不同收入水平的家庭之间存在性能不平等。我们的结果表明,在各类主题和国家中,较贫困群体的性能持续低于较富裕群体。我们强调了可帮助缓解这些问题的见解,并提出了迈向经济层面包容性AI开发的可行步骤。代码见 https://github.com/MichiganNLP/Bridging_the_Digital_Divide。
引用
@article{arxiv.2311.05746,
title = {Bridging the Digital Divide: Performance Variation across Socio-Economic Factors in Vision-Language Models},
author = {Joan Nwatu and Oana Ignat and Rada Mihalcea},
journal= {arXiv preprint arXiv:2311.05746},
year = {2023}
}