中文

为何数据匿名化未能普及

密码学与安全 2025-10-21 v2 计算机与社会

摘要

企业正寄望于数据匿名化研究——包括差分隐私和合成数据方法——以寻求简单直接的合规解决方案。但数据匿名化在实践中并未普及,因为其实施绝非易事。首先,它需要做出因案例而异的复杂选择,例如待匿名化数据集的领域、受保护的单位、数据保护应延伸的范围以及保护的标准。这些选择的每一种变化都会改变差分隐私(或任何其他数据匿名化度量)的含义及其实际影响。然而,差分隐私经常被标榜为提供相同的隐私保证,而不考虑这些选择上的差异。一些数据匿名化方法可以是有效的,但前提是所需的洞察粒度远大于保护单位。鉴于企业关注盈利能力,任何解决方案都必须保留企业数据与盈利能力之间的模式。因此,数据匿名化解决方案通常需要定制且针对特定案例,这降低了它们的可扩展性。企业不应期望轻易获胜,而应认识到匿名化只是实现数据隐私的一种途径,有其自身的特定优缺点,而最佳策略是联合利用数据隐私与安全的全套方法。

关键词

引用

@article{arxiv.2509.10165,
  title  = {Why Data Anonymization Has Not Taken Off},
  author = {Matthew J. Schneider and James Bailie and Dawn Iacobucci},
  journal= {arXiv preprint arXiv:2509.10165},
  year   = {2025}
}

备注

15 pages, to appear in Customer Needs and Solutions (v2 correcting formatting of reference list)