基于隐私保护文本重写的敏感数据众包
计算与语言
2023-03-07 v1
摘要
NLP 中大多数任务需要标注数据。出于可扩展性考虑,数据标注常在众包平台上进行。然而,只有在不含隐私相关信息时,数据才能发布于公共平台。文本数据常包含如人名或地名等敏感信息。本工作中,我们研究移除个人可识别信息(PII)以及应用差分隐私(DP)重写如何使含隐私相关信息的文本可用于众包。我们发现,众包前进行 DP 重写可保护隐私,同时仍对某些任务和数据带来良好的标注质量。PII 移除在所有考察任务中均带来良好标注质量,但无法提供隐私保证。
引用
@article{arxiv.2303.03053,
title = {Crowdsourcing on Sensitive Data with Privacy-Preserving Text Rewriting},
author = {Nina Mouhammad and Johannes Daxenberger and Benjamin Schiller and Ivan Habernal},
journal= {arXiv preprint arXiv:2303.03053},
year = {2023}
}