无表征即无分类:评估发展中国家开放数据集中的地理多样性问题
机器学习
2017-11-27 v1
摘要
现代机器学习系统(如图像分类器)在训练时严重依赖大规模数据集。此类数据集的创建成本高昂,因此实践中少数免费可用的开源数据集被广泛使用。我们建议在将数据集用于发展中国家用例之前,审视其地理多样性至关重要。我们分析了两个大型公开图像数据集以评估地理多样性,发现这些数据集似乎表现出可观测的以美洲和欧洲为中心的表征偏差。进一步,我们分析了在这些数据集上训练的分类器,以评估这些训练分布的影响,发现其对来自不同地区图像的相对性能存在显著差异。这些结果强调了在为发展中国家构建数据集时确保地理代表性的必要性。
引用
@article{arxiv.1711.08536,
title = {No Classification without Representation: Assessing Geodiversity Issues in Open Data Sets for the Developing World},
author = {Shreya Shankar and Yoni Halpern and Eric Breck and James Atwood and Jimbo Wilson and D. Sculley},
journal= {arXiv preprint arXiv:1711.08536},
year = {2017}
}
备注
Presented at NIPS 2017 Workshop on Machine Learning for the Developing World