中文

用于数据隐私算法基准测试的多样化社区数据

密码学与安全 2024-03-04 v3 机器学习

摘要

协同研究周期(CRC)是美国国家标准与技术研究院(NIST)的一项基准测试计划,旨在加强对表格数据去标识技术的理解。去标识算法易受影响其他数据分析和机器学习应用的相同偏差与隐私问题的影响,甚至可通过污染下游应用放大这些问题。本文总结了CRC的四项贡献:关于多样化人群与公平去标识挑战之间关系的理论工作;聚焦于多样化人群和具有挑战性特征的公开基准数据;一套用于去标识数据集的综合开源评估度量工具;以及来自广泛技术、超过450个去标识数据样本的档案。初步的评估结果表明了这些工具在该领域研究中的价值。

关键词

引用

@article{arxiv.2306.13216,
  title  = {Diverse Community Data for Benchmarking Data Privacy Algorithms},
  author = {Aniruddha Sen and Christine Task and Dhruv Kapur and Gary Howarth and Karan Bhagat},
  journal= {arXiv preprint arXiv:2306.13216},
  year   = {2024}
}