rx-anon——一种基于改进 Mondrian 算法的异质数据去标识化新方法
机器学习
2022-12-08 v2 密码学与安全
数据库
摘要
传统的数据匿名化方法将关系型数据与文本数据独立考虑。我们提出 rx-anon,一种面向由关系与文本属性组成的异质半结构化文档的匿名化方法。我们将从文本中提取的敏感词映射到结构化数据,从而可使用如 k-匿名性之类的概念来生成异质数据输入的统一、隐私保护版本。我们引入冗余敏感信息的概念以一致地匿名化异质数据。为控制匿名化对非结构化文本数据相对于结构化数据属性的影响,我们引入一种改进的、参数化的 Mondrian 算法。参数 允许在匿名化过程中对关系与文本属性赋予不同权重。我们使用两个真实世界数据集并以针对关系与文本数据联合匿名化问题调整的归一化确定性惩罚(Normalized Certainty Penalty)分数评估我们的方法。结果表明,我们的方法能够利用调优参数控制 Mondrian 划分,在保障关系属性及敏感词 k-匿名性的同时减少信息损失。由于 rx-anon 是一种框架性方法,它可被其他匿名化算法、隐私模型与文本相似度度量复用与扩展。
引用
@article{arxiv.2105.08842,
title = {rx-anon -- A Novel Approach on the De-Identification of Heterogeneous Data based on a Modified Mondrian Algorithm},
author = {Fabian Singhofer and Aygul Garifullina and Mathias Kern and Ansgar Scherp},
journal= {arXiv preprint arXiv:2105.08842},
year = {2022}
}
备注
Accepted paper of DocEng 2021