面向文本文档处理的广义差分隐私
密码学与安全
2019-02-06 v2 机器学习
摘要
我们研究如何通过去除可识别作者身份的文体线索来“混淆”文本,同时(尽可能多地)保留文本内容。本文将“广义差分隐私”的思想与用于文本处理的机器学习技术相结合,为文本文档建模隐私。我们定义了一种在表示为“词袋”的文本文档层面上运作的隐私机制——这类表示在机器学习中十分典型,且包含足够信息以执行包括主题识别与(原始文档的)作者归属在内的多种分类任务。我们证明该机制相对于一种语义相似性度量满足隐私要求,从而在由文本语义内容定义的效用与文体线索的混淆之间提供了平衡。我们在一个“同人小说”数据集上展示了我们的实现,证实确实可以在保留足够信息与变化以进行准确内容分类任务的同时,有效地伪装写作风格。
引用
@article{arxiv.1811.10256,
title = {Generalised Differential Privacy for Text Document Processing},
author = {Natasha Fernandes and Mark Dras and Annabelle McIver},
journal= {arXiv preprint arXiv:1811.10256},
year = {2019}
}
备注
Typos corrected