中文

去中心化 Web 上可扩展且隐私保护的合成数据生成

密码学与安全 2025-12-30 v2 机器学习

摘要

Web 上的数据推动了近期 AI 的诸多进展。随着高质量数据愈发难以获取,合成数据正成为隐私友好型数据发布及在开发稳健安全 AI 中补充真实数据集的有前景方案。但关于去中心化、可扩展且以贡献者为中心的合成数据生成系统的研究有限。近期名为 Libertas 的提案允许数据贡献者自主参与对其 Web 数据的联合计算,无需依赖可信中心。Libertas 使用 Solid(Social Linked Data)与 MPC(安全多方计算)实现该目标。Solid 是一种去中心化 Web 规范,允许任何人在其称为 Pod 的个人去中心化数据存储中安全存储数据,并控制哪些应用可访问其数据。MPC 指不同方在保持输入隐私前提下联合计算函数的一组密码学方法。因此,Libertas 也可用于以负责任方式从原本不可访问的 Web 数据生成合成数据,保障贡献者自治、去中心化与隐私。然而,由于 MPC 中高计算与通信开销,该系统可扩展性仍受限。本文展示如何借助安全飞地(除 MPC 外)改进 Libertas 以应对可扩展性挑战。Intel SGX 等安全飞地依赖基于硬件的特性保障代码与数据的机密性与完整性。我们讨论在 Libertas 架构中集成 SGX 以实现可扩展差分隐私合成数据生成的原则性方法,并借助模拟与真实数据集及不同合成数据生成算法的严谨实证结果支撑分析。

关键词

引用

@article{arxiv.2310.20062,
  title  = {Scalable and Privacy-Preserving Synthetic Data Generation on Decentralised Web},
  author = {Vishal Ramesh and Rui Zhao and Naman Goel},
  journal= {arXiv preprint arXiv:2310.20062},
  year   = {2025}
}

备注

Accepted at 24th IEEE/WIC International Conference on Web Intelligence and Intelligent Agent Technology 2025