中文

印尼人名的性别预测

计算与语言 2017-09-19 v2

摘要

我们研究了一种使用字符级 Long-Short Term Memory (char-LSTM) 预测名字性别的方法。我们将该方法与一些传统的机器学习方法进行了比较,即 Naive Bayes、logistic regression 和以 n-grams 为特征的 XGBoost。我们在一个由印尼人姓名组成的数据集上评估了这些模型。在印尼文化中,除了某些族群外,将家族姓氏作为姓氏并不常见。因此,我们从全名和名字中推断性别。结果表明,使用全名可以达到 92.25% 的准确率,而仅使用名字的准确率为 90.65%。这些结果优于将经典机器学习算法应用于 n-grams 的结果。

关键词

引用

@article{arxiv.1707.07129,
  title  = {Predicting the Gender of Indonesian Names},
  author = {Ali Akbar Septiandri},
  journal= {arXiv preprint arXiv:1707.07129},
  year   = {2017}
}

备注

Submitted to ICoDIS 2017