中文

NameBERT:基于LLM增强的开放学术数据中的规模化姓名-国籍分类

计算与语言 2026-04-22 v2

摘要

从个人姓名推断国籍是实现公平性和偏差监控、个性化以及医学和社会学研究中宝贵工具的关键能力。然而,现有的基于姓名的国籍分类器通常在相对较小或来源特定的标记数据集上进行训练,可能引入覆盖范围不足并限制对欠代表国家的性能。虽然大型语言模型(LLM)在姓名-based国籍预测方面表现出强大的零样例性能,但其计算成本和延迟使其难以在实际场景中进行大规模部署。本文我们从开放学术图谱(OAG)中创建了一个大型姓名-国籍数据集,并引入一种框架将LLM用作数据丰富器而非推断引擎。我们通过LLM生成的姓名来补充资源匮乏的国家,并在包含人工合成尾部姓名的测试集和不包含合成尾部姓名的测试集上进行评估。我们发现,当评估包括合成尾部姓名时,数据丰富产生显著提升;在不包含合成尾部姓名的评估中仍提供适度的尾部国家指标提升。总体而言,NameBERT模型在包含和不包含合成尾部姓名的测试集上均显著优于当前最先进的基线,同时在大规模推断方面比LLM更高效。

关键词

引用

@article{arxiv.2604.10401,
  title  = {NameBERT: Scaling Name-Based Nationality Classification with LLM-Augmented Open Academic Data},
  author = {Cong Ming and Ruixin Shi and Yifan Hu},
  journal= {arXiv preprint arXiv:2604.10401},
  year   = {2026}
}

备注

12 pages, 3 figures, 8 tables; accepted at the 39th Canadian Conference on Artificial Intelligence (Canadian AI 2026)