基于姓名预测民族与地区:神经模型与大语言模型的比较研究
计算与语言
2026-01-21 v2
摘要
从个人姓名预测民族在营销、人口统计研究和族谱学中具有实际价值。传统神经模型从任务特定的训练数据中学习姓名与民族之间的统计对应关系,这在针对低频民族和区分同一地区内相似民族方面存在挑战。大语言模型(LLM)有望通过利用在预训练期间获得的世界知识来解决这些挑战。本研究全面比较神经模型和 LLM 在民族预测上的表现,评估六个神经模型和六种 LLM 提示策略,在三个粒度水平(民族、地区和大陆)上进行评估,进行基于频率的分层分析和错误分析。结果表明,LLM 在所有粒度水平上均优于神经模型,差距随着粒度变得更粗略而缩小。简单的机器学习方法在频率鲁棒性方面表现最佳,而预训练模型和 LLM 在低频民族方面表现下降。错误分析揭示,LLM 倾向于进行“接近错误”,在民族错误的情况下预测正确的地区,而神经模型则表现出更大的跨地区错误并偏向高频类别。这表明 LLM 的优势源于世界知识,模型选择应考虑所需的粒度,评估应考虑准确率之外的错误质量。
引用
@article{arxiv.2601.08692,
title = {Nationality and Region Prediction from Names: A Comparative Study of Neural Models and Large Language Models},
author = {Keito Inoshita},
journal= {arXiv preprint arXiv:2601.08692},
year = {2026}
}