ER-AE:用于作者身份匿名化的差分隐私文本生成
密码学与安全
2021-05-14 v4 计算与语言
机器学习
摘要
大多数针对文本数据的隐私保护研究集中于移除显式敏感标识符。然而,作为作者身份强指示符的个人写作风格常被忽视。近期研究如 SynTF 在隐私保护文本挖掘上展示了有前景的结果。但其匿名化算法只能输出数值词项向量,接收方难以解释。我们提出一种带有双集合指数机制的新颖文本生成模型用于作者身份匿名化。通过 REINFORCE 训练奖励函数增强语义信息,该模型能生成差分隐私文本,其语义贴近且语法结构与原始文本相似,同时去除写作风格的个人特征。它不假设任何条件标签或平行文本数据用于训练。我们在真实同行评审数据集和 Yelp 评论数据集上评估所提模型性能。结果表明我们的模型在语义保持、作者混淆和文体测量变换上优于 SOTA。
引用
@article{arxiv.1907.08736,
title = {ER-AE: Differentially Private Text Generation for Authorship Anonymization},
author = {Haohan Bo and Steven H. H. Ding and Benjamin C. M. Fung and Farkhund Iqbal},
journal= {arXiv preprint arXiv:1907.08736},
year = {2021}
}