中文

Instate:根据姓氏预测居住州

计算机视觉与模式识别 2023-03-14 v1

摘要

印度有二十二种官方语言。为如此多样化的语言群体提供服务对调查统计人员、呼叫中心操作员、软件开发人员及其他此类服务提供者而言是一项挑战。为了通过更好的本地化向不同语言社区提供更好的服务,我们引入了一种新的机器学习模型,可根据用户姓名预测其能够使用的语言。利用来自印度选民名册语料库(?)的近 4.38 亿条记录、涵盖 33 个印度邦以及 113 万个唯一姓氏,我们构建了一个基于字符级 transformer 的机器学习模型,可根据姓氏预测居住州。该模型在未见姓名上的 top-3 准确率为 85.3%。我们利用印度人口普查将各邦映射到语言,以推断受访者所理解的语言。我们提供了实现本文所讨论方法的开源软件。

关键词

引用

@article{arxiv.2303.06823,
  title  = {Instate: Predicting the State of Residence From Last Name},
  author = {Atul Dhingra and Gaurav Sood},
  journal= {arXiv preprint arXiv:2303.06823},
  year   = {2023}
}