中文

解耦隐私保护BERT的语言能力

计算与语言 2023-10-18 v1

摘要

差分隐私(DP)已被定制用于应对文本到文本隐私化的独特挑战。然而,已知文本到文本隐私化会在扰动文本上训练时降低语言模型的性能。我们在基于扰动预文本训练的BERT所提取的内部表示上采用一系列解释技术,旨在从语言层面解耦差分隐私所引起的失真。来自表示相似性分析的实验结果表明,内部表示的整体相似性显著降低。利用探测任务来拆解这种不相似性,我们发现了证据:文本到文本隐私化影响了跨多种形式体系的语言能力,其对词的局部属性进行编码,却未能对词跨度的上下文关系进行编码。

关键词

引用

@article{arxiv.2310.11363,
  title  = {Disentangling the Linguistic Competence of Privacy-Preserving BERT},
  author = {Stefan Arnold and Nils Kemmerzell and Annika Schreiner},
  journal= {arXiv preprint arXiv:2310.11363},
  year   = {2023}
}