如何保持文本隐私?隐私保护自然语言处理的深度学习方法系统综述
计算与语言
2022-05-23 v1
摘要
用于自然语言处理(NLP)任务的深度学习(DL)模型经常处理私有数据,要求防范泄露与披露。诸如欧盟《通用数据保护条例》(GDPR)等数据保护法律因而强化了对隐私的需求。尽管近年来已提出许多隐私保护 NLP 方法,但尚未引入对其进行归类的体系,导致难以跟进文献进展。为弥补此缺口,本文系统综述了 2016 至 2020 年间发表的六十余种隐私保护 NLP 的 DL 方法,涵盖理论基础、隐私增强技术及其对真实场景适用性的分析。首先,我们引入一种新颖的分类法,将现有方法分为三类:数据保护方法、可信方法与验证方法。其次,我们广泛总结了隐私威胁、应用数据集与隐私评估指标。第三,我们在整个综述中以整体视角描述 NLP 流水线中的隐私问题。此外,我们讨论了隐私保护 NLP 在数据可追溯性、计算开销、数据集规模、嵌入中人类偏见的普遍性及隐私-效用权衡方面的开放挑战。最后,本综述提出未来研究方向,以指导隐私保护 NLP 模型的后续研发。
引用
@article{arxiv.2205.10095,
title = {How to keep text private? A systematic review of deep learning methods for privacy-preserving natural language processing},
author = {Samuel Sousa and Roman Kern},
journal= {arXiv preprint arXiv:2205.10095},
year = {2022}
}
备注
59 pages, 15 figures