中文

基于截断拉普拉斯机制的私有语言模型

计算与语言 2024-10-11 v1 人工智能 机器学习

摘要

深度学习模型在 NLP 任务中容易遭受各种隐私攻击。为防止隐私泄露,研究者们尝试在嵌入空间中进行词级扰动,依赖差分隐私(DP)的形式保证。然而,许多现有方法要么在使用拉普拉斯或高斯机制时在高隐私 regime 下性能不佳,要么采用弱化的 DP 松化形式,远不如标准 DP 在隐私强度方面优越。这引出一个问题:能否设计一种新的私有词嵌入方法来克服这些限制?本文提出一种称为高维截断拉普拉斯机制的新型私有嵌入方法。具体地,我们引入了一种对截断拉普拉斯机制的非平凡扩展,此前仅在一维空间情形中被考察。理论上,我们证明该方法比以往的私有词嵌入方法具有更低的方差。为进一步验证其有效性,我们在私有嵌入及下游任务上使用三个数据集进行了全面实验。令人惊讶的是,即便在高隐私 regime 下,我们的方法相较于非私有场景也仅引入轻微的效用下降。

关键词

引用

@article{arxiv.2410.08027,
  title  = {Private Language Models via Truncated Laplacian Mechanism},
  author = {Tianhao Huang and Tao Yang and Ivan Habernal and Lijie Hu and Di Wang},
  journal= {arXiv preprint arXiv:2410.08027},
  year   = {2024}
}

备注

Accepted by EMNLP 2024, Main Track