中文

利用大语言模型丰富数据集的人口统计学信息:名字里有什么?

计算与语言 2024-09-19 v1

摘要

从名字中丰富性别、种族和年龄等人口统计学信息,是医疗保健、公共政策和社会科学等领域的一项关键任务。这种人口统计学洞察有助于更精确、更有效地与目标人群互动。尽管先前已有工作尝试使用隐马尔可夫模型和循环神经网络从名字预测人口统计学信息,但仍存在显著局限:缺乏大规模、精心整理、无偏见的公开数据集,以及缺乏跨数据集稳健的方法。这种稀缺性阻碍了传统监督学习方法的发展。在本文中,我们证明了大语言模型(LLM)的零样本能力可以表现得与在专门数据上训练的特制模型一样好,甚至更好。我们在各种数据集上评估了我们的方法,包括一个来自香港的持牌金融专业人士的真实未标注数据集,并严格评估了这些模型中固有的人口统计学偏见。我们的工作不仅推进了人口统计学信息丰富化的最先进水平,也为未来研究减轻 LLM 中的偏见开辟了道路。

关键词

引用

@article{arxiv.2409.11491,
  title  = {Enriching Datasets with Demographics through Large Language Models: What's in a Name?},
  author = {Khaled AlNuaimi and Gautier Marti and Mathieu Ravaut and Abdulla AlKetbi and Andreas Henschel and Raed Jaradat},
  journal= {arXiv preprint arXiv:2409.11491},
  year   = {2024}
}

备注

8 pages, 7 Tables, 5 Figures