一种基于自动标注与联邦学习的隐私保护个人信息抽取方法
计算与语言
2021-05-20 v1
摘要
我们整理了 WikiPII,一个由维基百科传记页面组成、标注用于个人信息抽取的自动标注数据集。尽管自动标注可能导致较高程度的标签噪声,但它是廉价的过程且能生成大量标注文档。我们用 WikiPII 训练了一个基于 BERT 的 NER 模型,并表明在训练数据集足够大的情况下,尽管标签噪声水平高,该模型仍能显著降低人工信息抽取的成本。类似地,组织可利用文本挖掘技术从其历史数据创建定制化标注数据集,而无需共享原始数据供人工标注。此外,我们探索了在标注含噪情况下通过联邦学习对 NER 模型进行协作训练。我们的结果表明,取决于对 ML 操作者的信任程度及可用数据量,分布式训练可成为一种以隐私保护方式训练个人信息识别器的有效途径。研究资料见 https://github.com/ratmcu/wikipiifed。
引用
@article{arxiv.2105.09198,
title = {A Privacy-Preserving Approach to Extraction of Personal Information through Automatic Annotation and Federated Learning},
author = {Rajitha Hathurusinghe and Isar Nejadgholi and Miodrag Bolic},
journal= {arXiv preprint arXiv:2105.09198},
year = {2021}
}