中文

如何保持文本隐私?隐私保护自然语言处理的深度学习方法系统综述

计算与语言 2022-05-23 v1

摘要

用于自然语言处理(NLP)任务的深度学习(DL)模型经常处理私有数据,要求防范泄露与披露。诸如欧盟《通用数据保护条例》(GDPR)等数据保护法律因而强化了对隐私的需求。尽管近年来已提出许多隐私保护 NLP 方法,但尚未引入对其进行归类的体系,导致难以跟进文献进展。为弥补此缺口,本文系统综述了 2016 至 2020 年间发表的六十余种隐私保护 NLP 的 DL 方法,涵盖理论基础、隐私增强技术及其对真实场景适用性的分析。首先,我们引入一种新颖的分类法,将现有方法分为三类:数据保护方法、可信方法与验证方法。其次,我们广泛总结了隐私威胁、应用数据集与隐私评估指标。第三,我们在整个综述中以整体视角描述 NLP 流水线中的隐私问题。此外,我们讨论了隐私保护 NLP 在数据可追溯性、计算开销、数据集规模、嵌入中人类偏见的普遍性及隐私-效用权衡方面的开放挑战。最后,本综述提出未来研究方向,以指导隐私保护 NLP 模型的后续研发。

关键词

引用

@article{arxiv.2205.10095,
  title  = {How to keep text private? A systematic review of deep learning methods for privacy-preserving natural language processing},
  author = {Samuel Sousa and Roman Kern},
  journal= {arXiv preprint arXiv:2205.10095},
  year   = {2022}
}

备注

59 pages, 15 figures