中文

面向人力资源领域的荷兰语命名实体识别与去标识方法

计算与语言 2021-06-07 v1

摘要

人力资源(HR)领域包含各类隐私敏感文本数据,例如电子邮件往来与绩效评估。对这些文档开展研究带来若干挑战,其中之一是匿名化。本文通过四个步骤评估当前HR领域的荷兰语文本去标识方法。第一,通过使用最新的命名实体识别(NER)模型更新其中一种方法。结果是基于CoNLL 2002语料库的NER模型结合BERTje transformer给出了抑制人物(召回率0.94)和地点(召回率0.82)的最佳组合。对于抑制性别,DEDUCE表现最佳(召回率0.53)。第二,NER评估基于实体的严格去标识(人物必须作为人物被抑制)以及第三,基于宽松意义上的去标识(无论人物以何种方式被抑制,只要被抑制即可)。在第四也是最后一步,测试了一种用于识别文本中职位名称的新型NER数据集。

关键词

引用

@article{arxiv.2106.02287,
  title  = {Dutch Named Entity Recognition and De-identification Methods for the Human Resource Domain},
  author = {Chaïm van Toledo and Friso van Dijk and Marco Spruit},
  journal= {arXiv preprint arXiv:2106.02287},
  year   = {2021}
}