仅通过API访问LLM是否对生成私有合成表格数据有用?
机器学习
2025-02-11 v1 密码学与安全
摘要
差分隐私(DP)合成数据是一种灵活的工具,用于 enable 对私有数据的分析。最近的大型语言模型(LLM)发展激发了许多改进DP合成数据生成算法的技术。一种家族方法使用DP fine-tuning on foundation model weights;然而,针对 SOTA 模型的模型权重可能并不 public。在本工作中,我们提出两种仅需要对 foundation model 进行 API 访问的 DP 合成表格数据算法。我们将 Private Evolution algorithm (Lin et al., 2023; Xie et al., 2024) -- 该算法最初用于图像和文本数据 -- 扩展到表格数据领域。在我们对 Private Evolution 的扩展中,我们定义了基于查询工作量的距离度量,这可能独立地具有兴趣。我们提出了一系列算法,这些算法使用一次性 API 访问 LLM,而不是对 LLM 进行自适应查询。我们的发现表明,仅通过 API 访问强大的 LLM 并不总是能提高 DP 合成数据质量,这与一些 operate without such access 的 established baselines 进行比较。我们提供了洞察,以解释 underlying reasons,并提出改进 LLM 以更有效地用于此 application 的建议。
引用
@article{arxiv.2502.06555,
title = {Is API Access to LLMs Useful for Generating Private Synthetic Tabular Data?},
author = {Marika Swanberg and Ryan McKenna and Edo Roth and Albert Cheu and Peter Kairouz},
journal= {arXiv preprint arXiv:2502.06555},
year = {2025}
}