基于知识蒸馏与分布导师引导的LLM隐私数据增强用于医学文本分类
计算与语言
2024-02-27 v1 密码学与安全
摘要
由于模型训练并不总能公开获取充足数据,研究人员利用有限数据通过先进学习算法或数据增强(DA)扩展数据集。在私有领域进行DA需要隐私保护方法(如匿名化和扰动),但这些方法无法提供保护保证。差分隐私(DP)学习方法在理论上界定了保护,但不擅长使用大模型生成伪文本样本。本文将基于DP的伪样本生成任务转化为基于DP的生成样本判别任务,提出了一种结合LLM和DP判别器的DP-based DA方法,用于私有领域的文本分类。我们构建了一个知识蒸馏模型作为DP判别器:教师模型访问私有数据,指导学生如何选择带有校准噪声的私有样本以实现DP。为了约束DA生成的分布,我们提出了一种基于DP的导师,它对带噪的私有分布进行建模,并以较低的隐私成本控制样本生成。我们从理论上分析了模型的隐私保护,并通过实验验证了模型。
引用
@article{arxiv.2402.16515,
title = {LLM-based Privacy Data Augmentation Guided by Knowledge Distillation with a Distribution Tutor for Medical Text Classification},
author = {Yiping Song and Juhua Zhang and Zhiliang Tian and Yuxin Yang and Minlie Huang and Dongsheng Li},
journal= {arXiv preprint arXiv:2402.16515},
year = {2024}
}