从印度姓名中解码人口统计不公平性
计算机与社会
2022-09-08 v1 计算与语言
数字图书馆
机器学习
社会与信息网络
摘要
人口统计分类在推荐系统的公平性评估或在线网络与投票系统中非预期偏差的度量中至关重要。教育与政治等重要领域往往为社会平等的未来奠定基础,需要审视以设计能够在受该国不平衡人口分布约束下更好促进资源分配平等的政策。我们收集了三个公开可用数据集,以训练性别与种姓分类领域内最先进的分类器。我们在印度语境下训练模型,其中同一姓名可有不同书写惯例(某一邦的 Jolly Abraham/Kumar Abhishikta 在另一邦可能写作 Abraham Jolly/Abishikta Kumar)。最后,我们还进行了交叉测试(在不同数据集上训练与测试)以理解上述模型的有效性。我们还对预测模型进行了误差分析。最后,我们尝试以案例研究评估现有印度系统中的偏差,并发现次大陆在性别与种姓维度上复杂人口布局中显现出一些引人深思的模式。
引用
@article{arxiv.2209.03089,
title = {Decoding Demographic un-fairness from Indian Names},
author = {Medidoddi Vahini and Jalend Bantupalli and Souvic Chakraborty and Animesh Mukherjee},
journal= {arXiv preprint arXiv:2209.03089},
year = {2022}
}
备注
Accepted to SocInfo'22; code hosted at https://github.com/vahini01/IndianDemographics