私有数据插补
密码学与安全
2025-11-27 v1
摘要
数据插补是一项重要的数据准备任务,数据分析师通过替换缺失或错误的值来提高下游分析的预期准确性。数据插补的准确性提升也适用于跨分布式数据库的私有数据分析。然而,现有的数据插补方法侵犯了数据隐私,使得下游分析中的隐私保护形同虚设。我们得出结论:私有数据分析需要私有数据插补。在本文中,我们提出了首个用于私有数据插补的优化协议。我们考虑了数据水平分割和垂直分割的情况。我们的优化旨在将大部分计算简化为私有集合交集(或至少是不经意可编程伪随机函数)协议,这些协议可以非常高效地计算。我们表明,在所有评估的数据集上,私有数据插补在垂直分割数据的情况下,平均比本地插补数据具有20%的准确性优势,在水平分割数据的情况下具有5%的优势。在最差的数据分割情况下,我们观察到,使用我们的方法进行插补,在垂直分割数据上,插补质量提升高达32.7倍,在水平分割数据上提升3.4倍。我们的协议非常高效,在10 Gbps网络设置下,对100,000条记录执行一次数据插补,垂直分割数据仅需2.4秒,水平分割数据仅需8.4秒。
引用
@article{arxiv.2511.20832,
title = {Private Data Imputation},
author = {Abdelkarim Kati and Florian Kerschbaum and Marina Blanton},
journal= {arXiv preprint arXiv:2511.20832},
year = {2025}
}