印尼人名的性别预测
计算与语言
2017-09-19 v2
摘要
我们研究了一种使用字符级 Long-Short Term Memory (char-LSTM) 预测名字性别的方法。我们将该方法与一些传统的机器学习方法进行了比较,即 Naive Bayes、logistic regression 和以 n-grams 为特征的 XGBoost。我们在一个由印尼人姓名组成的数据集上评估了这些模型。在印尼文化中,除了某些族群外,将家族姓氏作为姓氏并不常见。因此,我们从全名和名字中推断性别。结果表明,使用全名可以达到 92.25% 的准确率,而仅使用名字的准确率为 90.65%。这些结果优于将经典机器学习算法应用于 n-grams 的结果。
引用
@article{arxiv.1707.07129,
title = {Predicting the Gender of Indonesian Names},
author = {Ali Akbar Septiandri},
journal= {arXiv preprint arXiv:1707.07129},
year = {2017}
}
备注
Submitted to ICoDIS 2017