一种基于差分隐私的定制化文本净化机制
密码学与安全
2023-09-04 v2 计算与语言
摘要
随着自然语言处理(NLP)领域对隐私问题的日益关注,已有众多方法被提出以在差分隐私约束下对文本进行净化。然而,基于度量局部差分隐私(MLDP)的现有最优文本净化机制不适用于非度量的语义相似度度量,且无法在隐私与效用之间取得良好权衡。为克服上述局限,我们提出了一种基于原始-差分隐私(DP)定义的新型定制化文本(CusText)净化机制,该机制与任意相似度度量兼容。此外,CusText为每个输入词元分配一个定制化的输出词元集合,从而在词元级别提供更高级别的隐私保护。在多个基准数据集上的大量实验表明,CusText比现有机制实现了更好的隐私-效用权衡。代码见 https://github.com/sai4july/CusText。
引用
@article{arxiv.2207.01193,
title = {A Customized Text Sanitization Mechanism with Differential Privacy},
author = {Huimin Chen and Fengran Mo and Yanhao Wang and Cen Chen and Jian-Yun Nie and Chengyu Wang and Jamie Cui},
journal= {arXiv preprint arXiv:2207.01193},
year = {2023}
}
备注
This work has been accepted to the Findings of ACL 2023