中文

招聘信息中隐私相关实体的去标识化

计算与语言 2021-05-25 v1

摘要

去标识化是检测文本中隐私相关实体(如人名、电子邮件和联系数据)的任务。该任务在医疗领域已得到充分研究。由于许多领域对隐私保护数据处理的需求很高,对去标识化技术的需求正在增长。在本文中,我们关注招聘信息。我们提出了 JobStack,一个用于 Stackoverflow 上招聘职位中个人数据去标识化的新语料库。我们引入了基线,比较了长短期记忆(LSTM)和 Transformer 模型。为改进这些基线,我们通过多任务学习实验了上下文嵌入和远距离相关的辅助数据。我们的结果表明,辅助数据提升了去标识化性能。令人惊讶的是,原始 BERT 被证明比在其他 Stackoverflow 部分上训练的 BERT 模型更有效。

关键词

引用

@article{arxiv.2105.11223,
  title  = {De-identification of Privacy-related Entities in Job Postings},
  author = {Kristian Nørgaard Jensen and Mike Zhang and Barbara Plank},
  journal= {arXiv preprint arXiv:2105.11223},
  year   = {2021}
}

备注

12 pages, 1 figure, 6 tables, accepted in NoDaLiDa 2021