中文

通过全贝叶斯改进姓氏地理编码与姓名补充解决人口普查数据在种族插补中的问题

机器学习 2022-09-02 v3 机器学习

摘要

个体种族与族裔的预测在社会科学和公共卫生研究中起着重要作用。例子包括健康与投票中种族差异的研究。近来,贝叶斯改进姓氏地理编码(BISG)利用贝叶斯规则将人口普查姓氏文件的信息与个体住所的地理编码相结合,已成为该预测任务的主流方法。遗憾的是,BISG 存在两个人口普查数据问题,导致对少数族裔的预测表现不佳。首先,十年一次的人口普查在这些群体部分成员居住的普查块中常包含少数族裔种族群体的零计数。其次,由于人口普查姓氏文件仅包含常见姓名,许多姓氏——尤其是少数族裔的姓氏——不在列表中。为解决零计数问题,我们引入了全贝叶斯改进姓氏地理编码(fBISG)方法,其通过将 BISG 方法的朴素贝叶斯推断扩展为完整后验推断,来考虑人口普查计数中潜在的测量误差。为解决缺失姓氏问题,我们用取自六个南部州选民文件的关于姓、名和中间名的额外数据补充人口普查姓氏数据,这些文件中包含自我报告的种族。我们的经验验证表明,fBISG 方法和姓名补充显著提高了所有种族群体尤其是亚裔的种族插补准确性。所提出的方法及额外姓名数据可通过开源软件 WRU 获取。

关键词

引用

@article{arxiv.2205.06129,
  title  = {Addressing Census data problems in race imputation via fully Bayesian Improved Surname Geocoding and name supplements},
  author = {Kosuke Imai and Santiago Olivella and Evan T. R. Rosenman},
  journal= {arXiv preprint arXiv:2205.06129},
  year   = {2022}
}