招聘信息中隐私相关实体的去标识化
计算与语言
2021-05-25 v1
摘要
去标识化是检测文本中隐私相关实体(如人名、电子邮件和联系数据)的任务。该任务在医疗领域已得到充分研究。由于许多领域对隐私保护数据处理的需求很高,对去标识化技术的需求正在增长。在本文中,我们关注招聘信息。我们提出了 JobStack,一个用于 Stackoverflow 上招聘职位中个人数据去标识化的新语料库。我们引入了基线,比较了长短期记忆(LSTM)和 Transformer 模型。为改进这些基线,我们通过多任务学习实验了上下文嵌入和远距离相关的辅助数据。我们的结果表明,辅助数据提升了去标识化性能。令人惊讶的是,原始 BERT 被证明比在其他 Stackoverflow 部分上训练的 BERT 模型更有效。
引用
@article{arxiv.2105.11223,
title = {De-identification of Privacy-related Entities in Job Postings},
author = {Kristian Nørgaard Jensen and Mike Zhang and Barbara Plank},
journal= {arXiv preprint arXiv:2105.11223},
year = {2021}
}
备注
12 pages, 1 figure, 6 tables, accepted in NoDaLiDa 2021