中文

我们能信任种族预测吗?

机器学习 2023-08-09 v2 人工智能 计算机与社会 机器学习

摘要

在缺乏敏感的种族与族裔数据的情况下,研究人员、监管者与公司均转向代理变量。在本文中,我在来自美国全部 50 个州的选民登记数据这一新颖数据集上训练了一个双向长短期记忆(BiLSTM)模型,并构建了一个集成模型,其样本外(OOS)F1 分数比文献中性能最佳的机器学习模型高出至多 36.8%。此外,我构建了美国最全面的首名与姓氏分布数据库,以提升贝叶斯改进姓氏地理编码(BISG)与贝叶斯改进姓名姓氏地理编码(BIFSG)的覆盖度与准确度。最后,我提供了首个高质量基准数据集,以便公平比较现有模型并辅助未来的模型开发者。

关键词

引用

@article{arxiv.2307.08496,
  title  = {Can We Trust Race Prediction?},
  author = {Cangyuan Li},
  journal= {arXiv preprint arXiv:2307.08496},
  year   = {2023}
}