中文

论一种功利主义的隐私保护文本生成方法

计算与语言 2021-04-27 v1

摘要

用于文本生成的差分隐私机制通常向输入词添加经过精细校准的噪声,并使用加噪输入的最近邻作为输出词。当噪声幅度较小时,这些机制易受原始敏感文本重建的攻击。这是因为加噪输入的最近邻很可能是原始输入。为缓解这一经验隐私风险,我们提出了一类新颖的差分隐私机制,其对传统机制中的最近邻选择准则进行参数化。受 Vickrey 拍卖(仅揭示第二高价而保留最高价私密)的启发,我们在所提机制类中使用一个调谐参数来平衡第一最近邻与第二最近邻之间的选择。该参数通过经验求解一个约束优化问题来选取,以在保持所需隐私保证的同时最大化效用。我们论证了这一经验度量框架可用于将不同机制沿其隐私-效用权衡的通用基准对齐,尤其当使用不同距离度量来校准所添加噪声量时。我们在真实文本分类数据集上的实验表明,在相同的经验隐私保证下,效用相较现有最优水平提升高达 50%。

关键词

引用

@article{arxiv.2104.11838,
  title  = {On a Utilitarian Approach to Privacy Preserving Text Generation},
  author = {Zekun Xu and Abhinav Aggarwal and Oluwaseyi Feyisetan and Nathanael Teissier},
  journal= {arXiv preprint arXiv:2104.11838},
  year   = {2021}
}

备注

10 pages, 3 figures