无障碍数据集中的数据代表性:一项元分析
人机交互
2022-09-21 v2 人工智能
摘要
随着数据驱动系统日益大规模部署,围绕训练数据中代表性不足的历史边缘化群体所遭受不公平和歧视性结果的伦理关切已然出现。作为回应,关于 AI 公平性与包容性的工作呼吁建立能代表各类人口群体的数据集。在本文中,我们贡献了一项关于无障碍数据集——源自残障人士与老年人的数据集——中年龄、性别以及种族与族裔代表性的分析,这类数据集可能在缓解注入 AI 的包容性应用的偏差方面发挥重要作用。我们通过审阅 190 个数据集的公开可用信息(我们称之为无障碍数据集)来考察残障人士来源数据集当前的代表性状态。我们发现无障碍数据集代表了多样的年龄,但存在性别与种族代表性缺口。此外,我们调查了人口变量的敏感与复杂性质如何致使分类困难且不一致(例如性别、种族与族裔),且标注来源常未知。通过反思残障数据贡献者代表性的当前挑战与机遇,我们希望我们的努力拓展注入 AI 的系统中更大程度包容边缘化社区的可能性空间。
引用
@article{arxiv.2207.08037,
title = {Data Representativeness in Accessibility Datasets: A Meta-Analysis},
author = {Rie Kamikubo and Lining Wang and Crystal Marte and Amnah Mahmood and Hernisa Kacorri},
journal= {arXiv preprint arXiv:2207.08037},
year = {2022}
}
备注
Preprint, The 24th International ACM SIGACCESS Conference on Computers and Accessibility (ASSETS 2022), 15 pages