从姓名字符序列预测种族与族裔
应用统计
2023-07-13 v2 机器学习
摘要
为了回答有关种族不平等与公平的问题,我们常常需要一种从姓名推断种族与族裔的方法。一种方法是依赖人口普查局的流行姓氏列表。然而,该列表至少有三个局限:1. 它仅包含姓氏;2. 它仅包括流行姓氏;3. 它每 10 年更新一次。为了提供更好的泛化能力,并在有名字可用时获得更高准确率,我们使用多种技术对姓名中字符与种族和族裔之间的关系进行建模。使用长短期记忆 (Long Short-Term Memory, LSTM) 的模型表现最佳,样本外准确率为 .85。表现最佳的姓氏模型样本外准确率为 .81。为说明这些模型的效用,我们将其应用于竞选财务数据以估计各种族群体捐款所占份额,并应用于新闻数据以估计新闻中各种族与族裔的覆盖率。
引用
@article{arxiv.1805.02109,
title = {Predicting Race and Ethnicity From the Sequence of Characters in a Name},
author = {Rajashekar Chintalapati and Suriyan Laohaprapanon and Gaurav Sood},
journal= {arXiv preprint arXiv:1805.02109},
year = {2023}
}