文非我所写:隐私保护文本表示学习
密码学与安全
2019-07-09 v1 社会与信息网络
摘要
在线用户通过参与不同活动(如撰写评论和分享推文)产生海量文本信息。这些文本数据为研究者和商业伙伴研究和理解个体提供了机会。然而,这类用户生成的文本数据不仅能揭示用户身份,还可能包含个人隐私信息(如年龄、位置、性别)。因此,俗语有云“文如其人”。发布文本数据因而会损害提供数据的个体的隐私。数据发布者需要在发布前对数据进行匿名化以保护人们隐私的需求由此产生。设计有效的文本信息匿名化技术具有挑战性,该技术需在最小化再识别可能且不包含用户敏感信息(高隐私)的同时,为给定任务保留数据的语义含义(高效用)。本文研究该问题并提出一种新颖的双重隐私保护文本表示学习框架DPText,其学习的文本表示具有:(1)满足差分隐私,(2)不包含隐私信息,(3)对给定任务保持高效用。通过在情感分析和词性标注两项自然语言处理任务上的评估,我们展示了该方法在隐私与效用双重保护方面的有效性。
引用
@article{arxiv.1907.03189,
title = {I Am Not What I Write: Privacy Preserving Text Representation Learning},
author = {Ghazaleh Beigi and Kai Shu and Ruocheng Guo and Suhang Wang and Huan Liu},
journal= {arXiv preprint arXiv:1907.03189},
year = {2019}
}
备注
This is an extended version of the original paper published as a poster paper in the proceedings of the 30th ACM Conference on Hypertext and Social Media (HyperText'19)