未筛选图像-文本数据集:揭示人口统计偏差
计算机视觉与模式识别
2023-04-07 v1 计算机与社会
摘要
收集大规模未筛选数据集以训练视觉-语言模型的趋势日益增强,这引发了关于公平表征的担忧。已知即便是如 MSCOCO 般小规模但人工标注的数据集也受社会偏见影响。该问题远未解决,且随着从互联网抓取且缺乏管控的数据而可能加剧。此外,缺乏分析大型图像集合中社会偏见的工具,使得应对该问题极具挑战。我们的首要贡献是标注被广泛用于训练视觉-语言模型的 Google Conceptual Captions 数据集的一部分,标注含四个人口统计属性与两个上下文属性。我们的第二大贡献是对标注进行全面分析,聚焦不同人口群体如何被表征。我们最后的贡献在于评估三种主流视觉-语言任务:图像描述、文本-图像 CLIP 嵌入与文本到图像生成,表明社会偏见在所有任务中均为持续性问题。
引用
@article{arxiv.2304.02828,
title = {Uncurated Image-Text Datasets: Shedding Light on Demographic Bias},
author = {Noa Garcia and Yusuke Hirota and Yankun Wu and Yuta Nakashima},
journal= {arXiv preprint arXiv:2304.02828},
year = {2023}
}
备注
CVPR 2023