基于梯度匹配的大型语言模型合成文本生成
机器学习
2025-06-10 v2 计算与语言
摘要
合成数据有望提高真实训练样本的性能、训练效率和隐私。尽管如此,现有合成文本生成方法大多为启发式方法,无法在不泄露真实数据隐私的前提下生成人类可读文本,或无法为在大型语言模型(LLM)上进行微调提供性能保证。本文提出首个在生成人类可读文本方面具有收敛性、性能和隐私保证的合成文本方法。为实现此目标,我们利用交替方向乘子法(ADMM)迭代优化合成样本的嵌入向量,以匹配目标训练或验证数据的噪声梯度,并将其映射到低困惑度的文本标记序列。通过这种方式,生成的合成文本可保证模型在对真实数据进行微调后收敛于该解的邻近区域,同时保留其隐私。在各种分类任务上的实验结果表明,我们的方法有效。我们的代码已公开于 https://github.com/BigML-CS-UCLA/GRADMM。
引用
@article{arxiv.2502.17607,
title = {Synthetic Text Generation for Training Large Language Models via Gradient Matching},
author = {Dang Nguyen and Zeman Li and Mohammadhossein Bateni and Vahab Mirrokni and Meisam Razaviyayn and Baharan Mirzasoleiman},
journal= {arXiv preprint arXiv:2502.17607},
year = {2025}
}
备注
18 pages, 10 figures, 5 tables, link: https://github.com/BigML-CS-UCLA/GRADMM