中文

利用嵌入模型改进概率种族预测

计算与语言 2026-04-29 v2

摘要

估计种族差异需要个体层面的种族数据,但由于收集此类信息的敏感性,这些数据通常不可用。为解决此问题,许多研究人员使用贝叶斯改进姓氏地理编码(BISG),该方法严重依赖于人口普查姓氏数据。不幸的是,这些数据仅捕捉常见姓氏的种族-姓氏关系,遗漏了约10%的美国人口。我们表明,对于拥有这些被遗漏的不常见姓氏的个体,预测性能会大幅下降,因为标准BISG实现在这种情况下依赖于一个信息量很少的通用先验。为克服这一限制,我们提出了嵌入驱动的BISG(eBISG),它使用预训练文本嵌入将姓名表示为稠密向量,并在2020年人口普查姓氏和名字数据上训练神经网络,以估计人口普查未覆盖姓名的种族概率。我们比较了五种方法:仅使用姓氏的标准BISG、结合名字概率的BIFSG、针对未列出姓氏的姓氏嵌入、结合姓氏和名字的嵌入,以及一个在南方各州选民档案数据上训练的、捕捉姓名组成部分之间交互的全名嵌入。我们表明,每种后续的eBISG方法都改进了种族预测,其中全名嵌入带来了最大的提升,特别是对于姓氏不在人口普查列表中的西班牙裔和亚裔选民。

关键词

引用

@article{arxiv.2604.22555,
  title  = {Using Embedding Models to Improve Probabilistic Race Prediction},
  author = {Noah Dasanaike and Kosuke Imai},
  journal= {arXiv preprint arXiv:2604.22555},
  year   = {2026}
}