ClustEm4Ano:聚类标称文本属性的文本嵌入以用于微数据匿名化
计算与语言
2024-12-18 v1 人工智能
摘要
本工作介绍了 ClustEm4Ano,这是一种匿名化流水线,可用于标称文本表格数据的泛化和基于抑制的匿名化。它自动生成值泛化层次结构(VGHs),进而可用于泛化准标识符中的属性。该流水线利用嵌入通过迭代聚类生成语义上接近的值泛化。我们在13种不同的预定义文本嵌入(包括开源和闭源(通过API))上应用了 KMeans 和层次凝聚聚类。我们的方法在著名的匿名化基准数据集上进行了实验测试:UCI机器学习库的 Adult 数据集。与使用任意选择的 VGHs 相比,ClustEm4Ano 通过提供更多可能性来支持匿名化过程。实验表明,这些 VGHs 在下游效能方面可以优于手动构建的 VGHs(特别是对于较小的 -匿名性()),从而可以提高匿名化数据集的质量。我们的实现已公开。
引用
@article{arxiv.2412.12649,
title = {ClustEm4Ano: Clustering Text Embeddings of Nominal Textual Attributes for Microdata Anonymization},
author = {Robert Aufschläger and Sebastian Wilhelm and Michael Heigl and Martin Schramm},
journal= {arXiv preprint arXiv:2412.12649},
year = {2024}
}
备注
16 pages, 5 figures, accepted for presentation at IDEAS: 2024 28th International Symposium on Database Engineered Applications, Bayonne, France, August 26-29, 2024