通过无大规模 LLM 微调合成隐私保护文本数据
计算与语言
2025-07-18 v2
摘要
合成数据作为在保护数据隐私的前提下训练模型的可行路径具有潜力。对大型语言模型(LLM)进行差分隐私(DP)微调作为数据生成器是有效的,但在计算资源有限时是不可行的。同时,诸如私有演化等基于提示的方法高度依赖手动提示,且在迭代数据选择过程中未有效利用私有信息。为克服这些限制,我们提出了CTCL(数据合成具有可控性和聚类)框架,用于无需 extensive 提示工程或大规模 LLM 微调生成隐私保护合成数据。CTCL 在大规模公共数据上预训练了一个轻量级 140M 条件生成器和基于聚类的主题模型。为进一步适应私有领域,该生成器在私有数据上进行 DP 微调以获取细粒度文本信息,而主题模型提取表示分布信息的 DP 柱状图。DP 生成器随后根据 DP 柱状图对采样以合成所需数量的数据示例。跨五个多样化领域的评估表明了该框架的有效性,特别是在强隐私 regime 中。系统性消融实验验证了框架每个组件的设计,并突显了该方法的可扩展性。
引用
@article{arxiv.2503.12347,
title = {Synthesizing Privacy-Preserving Text Data via Finetuning without Finetuning Billion-Scale LLMs},
author = {Bowen Tan and Zheng Xu and Eric Xing and Zhiting Hu and Shanshan Wu},
journal= {arXiv preprint arXiv:2503.12347},
year = {2025}
}
备注
Code available at https://github.com/tanyuqian/synthetic-private-data