简历中的命名实体识别
计算与语言
2023-06-23 v1
摘要
命名实体识别(NER)用于从各类文档与文本中提取姓名、日期等信息。为筛选简历,从中提取教育与工作经历信息十分重要。考虑到简历中的所有信息都需手动录入公司系统,将该过程自动化可为公司节省时间。本研究实现了一个基于深度学习的半自动命名实体识别系统,重点关注 IT 领域的简历。首先,对来自五个不同 IT 相关领域的员工简历进行了标注。利用标注数据,将六种基于 transformer 的预训练模型适配于命名实体识别任务。这些模型选自自然语言处理领域的主流模型。所得系统可识别八类实体:城市、日期、学位、专业、职位、语言、国家与技能。实验中使用微平均、宏平均与加权平均 F1 分数对模型进行比较并评估方法性能。综合测试集上的这些分数,RoBERTa 取得了最佳的微平均与加权平均 F1 分数,而 Electra 模型取得了最佳的宏平均 F1 分数。
引用
@article{arxiv.2306.13062,
title = {Named entity recognition in resumes},
author = {Ege Kesim and Aysu Deliahmetoglu},
journal= {arXiv preprint arXiv:2306.13062},
year = {2023}
}
备注
in Turkish language