中文

设计差分隐私文本生成机制的挑战

机器学习 2020-12-11 v1 计算与语言 密码学与安全

摘要

在确保可量化隐私保障的同时从用户数据中准确学习,为构建更好的机器学习(ML)模型同时保持用户信任提供了契机。近期文献已证明广义差分隐私形式在文本查询上提供保障的适用性。此类机制向高维文本的向量表示中添加隐私保护噪声,并返回噪声向量的基于文本的投影。然而,这些机制在隐私与效用的权衡上并非最优。这是由于诸如固定全局敏感度等因素导致在稠密空间中添加了过多噪声,同时却为敏感离群点提供了保护。在本提案论文中,我们描述了在这些差分隐私文本机制中平衡隐私与效用权衡的一些挑战。在较高层面上,我们提供两项提议:(1)一个名为LAC的框架,将部分噪声推迟至隐私放大步骤;(2)一套基于词周围局部区域校准噪声的三种不同技术的附加套件。本文的目标并非评估单一解决方案,而是推进有关这些挑战的讨论并为构建更好机制规划路径。

关键词

引用

@article{arxiv.2012.05403,
  title  = {Research Challenges in Designing Differentially Private Text Generation Mechanisms},
  author = {Oluwaseyi Feyisetan and Abhinav Aggarwal and Zekun Xu and Nathanael Teissier},
  journal= {arXiv preprint arXiv:2012.05403},
  year   = {2020}
}

备注

14 pages, 1 figure