中文

用人工智能增强匿名化数据:探索大语言模型在数据丰富中的可行性与局限性

密码学与安全 2025-04-08 v1 新兴技术

摘要

大语言模型(LLM)在文本生成和理解方面都展现了先进的能力,将其应用于数据档案可能有助于数据主体敏感信息的私有化。事实上,数据中包含的信息通常包括敏感且可识别个人身份的细节。这些数据如果未加保护,可能会在披露和识别方面带来隐私风险。此外,应用匿名化技术(如k-匿名性)可能导致数据源中数据量显著减少,从而可能降低预测过程的有效性。在我们的研究中,我们调查了LLM在不影响匿名性的情况下丰富匿名化数据源的能力。为此,我们设计了新的特制提示模板工程策略来执行匿名化数据增强,并评估基于LLM的方法在提供匿名化数据方面的有效性。为了验证LLM提供的匿名化保证,我们利用了pyCanon库,该库旨在通过匿名化评估与最常见隐私保护技术相关的参数值。我们在真实世界数据集上进行的实验表明,LLM为此目标产生了有希望的结果。

关键词

引用

@article{arxiv.2504.03778,
  title  = {Augmenting Anonymized Data with AI: Exploring the Feasibility and Limitations of Large Language Models in Data Enrichment},
  author = {Stefano Cirillo and Domenico Desiato and Giuseppe Polese and Monica Maria Lucia Sebillo and Giandomenico Solimando},
  journal= {arXiv preprint arXiv:2504.03778},
  year   = {2025}
}

备注

Stefano Cirillo, Domenico Desiato, Giuseppe Polese, Monica Maria Lucia Sebillo, Giandomenico Solimando: Augmenting Anonymized Data with AI: Exploring the Feasibility and Limitations of Large Language Models in Data Enrichment. In proceedings of the 3rd Italian Conference on Big Data and Data Science (ITADATA 2024), 17-19 September 2024, Pisa, Italy