中文

简历中的命名实体识别

计算与语言 2023-06-23 v1

摘要

命名实体识别(NER)用于从各类文档与文本中提取姓名、日期等信息。为筛选简历,从中提取教育与工作经历信息十分重要。考虑到简历中的所有信息都需手动录入公司系统,将该过程自动化可为公司节省时间。本研究实现了一个基于深度学习的半自动命名实体识别系统,重点关注 IT 领域的简历。首先,对来自五个不同 IT 相关领域的员工简历进行了标注。利用标注数据,将六种基于 transformer 的预训练模型适配于命名实体识别任务。这些模型选自自然语言处理领域的主流模型。所得系统可识别八类实体:城市、日期、学位、专业、职位、语言、国家与技能。实验中使用微平均、宏平均与加权平均 F1 分数对模型进行比较并评估方法性能。综合测试集上的这些分数,RoBERTa 取得了最佳的微平均与加权平均 F1 分数,而 Electra 模型取得了最佳的宏平均 F1 分数。

关键词

引用

@article{arxiv.2306.13062,
  title  = {Named entity recognition in resumes},
  author = {Ege Kesim and Aysu Deliahmetoglu},
  journal= {arXiv preprint arXiv:2306.13062},
  year   = {2023}
}

备注

in Turkish language