中文

将上下文引入文本到文本隐私化

计算与语言 2023-06-05 v1 机器学习

摘要

度量差分隐私(Metric Differential Privacy)通过对源自嵌入空间的词向量添加经标定的噪声,并使用最近邻搜索将该含噪向量投影回离散词表,从而实现文本到文本的隐私化。由于词语是在无上下文情况下被替换的,该机制在寻找具有歧义含义词语(如“bank”)的替代词时预期表现不佳。为处理这些歧义词语,我们利用义项嵌入并在噪声注入前引入义项消歧步骤。我们将对隐私化机制的这一修改与隐私性和效用的估计相结合。在Words in Context数据集上的词义消歧任务中,我们展示了分类准确率提升了6.05%。

关键词

引用

@article{arxiv.2306.01457,
  title  = {Driving Context into Text-to-Text Privatization},
  author = {Stefan Arnold and Dilara Yesilbas and Sven Weinzierl},
  journal= {arXiv preprint arXiv:2306.01457},
  year   = {2023}
}