基于机器学习技术的越南语姓名性别预测
计算与语言
2021-03-24 v4
摘要
由于生理性别是呈现个体人类的一个方面,基于人名的性别分类已有很多工作。针对英语和汉语的提议极为丰富;然而,迄今为止针对越南语的此类工作甚少。我们提出了一个基于越南语姓名的性别预测新数据集。该数据集包含超过 26,000 个标注了性别的全名。该数据集已在我们的网站上提供以用于研究目的。此外,本文描述了六种机器学习算法(支持向量机、多项朴素贝叶斯、伯努利朴素贝叶斯、决策树、随机森林与逻辑回归)以及一个深度学习模型 (LSTM),结合 fastText 词嵌入用于越南语姓名的性别预测。我们创建了数据集并研究了各姓名成分对性别检测的影响。结果,我们在 LSTM 模型上取得的最高 F1-score 达 96%,并基于我们的训练模型生成了一个 Web API。
引用
@article{arxiv.2010.10852,
title = {Gender Prediction Based on Vietnamese Names with Machine Learning Techniques},
author = {Huy Quoc To and Kiet Van Nguyen and Ngan Luu-Thuy Nguyen and Anh Gia-Tuan Nguyen},
journal= {arXiv preprint arXiv:2010.10852},
year = {2021}
}
备注
6 pages, 6 figures. NLPIR 2020: 4th International Conference on Natural Language Processing and Information Retrieval