中文

面向具有隐私保证的敏感文档发布

密码学与安全 2017-01-03 v1

摘要

对于现代信息社会而言,隐私已成为一个严重的关切。每日交换或发布给不可信方的诸多数据具有敏感性质,这要求负责任的组织采取适当的隐私保护措施。如今,这些数据大部分是文本(例如电子邮件、社交媒体上发布的消息、医疗保健结果等),由于其非结构化和语义特性,对自动数据保护方法构成了挑战。事实上,文本文档通常在被称为文档编辑或脱敏 的过程中受到人工保护。为此,人类专家识别敏感术语(即可能揭示身份和/或机密信息的术语)并相应地对其进行保护(例如通过移除,或更优选地,通过泛化)。为了将专家从这一繁重的任务中解脱出来,在先前的工作中我们引入了 C-sanitization 的理论基础,这是一种内在的语义隐私模型,为开发自动文档编辑/脱敏算法提供了基础,并对数据保护提供了清晰且先验的隐私保证;尽管 C-sanitization 具有潜在益处,但在应用于实践时仍存在一些局限性(主要在灵活性、效率和准确性方面)。在本文中,我们提出了一种更灵活的新模型,命名为 (C, g(C))-sanitization,该模型能够直观地配置期望的保护水平(即受控的信息披露)与受保护数据的效用保持(即保留的语义数量)之间的权衡。此外,我们还提出了一组技术解决方案和算法,提供了该模型高效且可扩展的实现并提高了其实际准确性,我们也通过实证实验对此进行了说明。

关键词

引用

@article{arxiv.1701.00436,
  title  = {Toward sensitive document release with privacy guarantees},
  author = {David Sánchez and Montserrat Batet},
  journal= {arXiv preprint arXiv:1701.00436},
  year   = {2017}
}