基于数据向量的高效隐私合成数据生成
计算与语言
2026-02-26 v1 人工智能
密码学与安全
机器学习
摘要
高质量数据是现代机器学习的必需品,但许多珍贵语料库是敏感的,无法 freely 共享。合成数据作为下游开发的实用替代品,大型语言模型 (LLM) 已成为生成它的强大引擎。然而,现有的私有文本生成方法效率极低:数据密集、计算缓慢,往往需要大型私有语料库或大批量样本才能实现可用质量。我们引入 EPSVec,一种差分隐私轻量级替代方案,通过数据向量引导 LLM 生成。数据向量是捕获私有数据与公共先验之间分布差异的激活空间中的方向。EPSVec 提取并消毒一次性引导向量,然后进行标准解码。这将隐私预算与生成解耦,使可生成任意数量的合成样本而无需额外隐私成本,甚至在低数据 regime 下也能实现强大的保真度。此外,我们利用预训练 (base) 模型并引入固定-shot 提示以提升生成的多样性和保真度。我们的实验表明,EPSVec 在分布对齐和下游实用性方面优于现有基线,尤其在低数据 regime 下,显著减少了计算开销。
引用
@article{arxiv.2602.21218,
title = {EPSVec: Efficient and Private Synthetic Data Generation via Dataset Vectors},
author = {Amin Banayeeanzade and Qingchuan Yang and Deqing Fu and Spencer Hong and Erin Babinsky and Alfy Samuel and Anoop Kumar and Robin Jia and Sai Praneeth Karimireddy},
journal= {arXiv preprint arXiv:2602.21218},
year = {2026}
}