中文

通过播种大语言模型提示词实现私密文本生成

计算与语言 2025-02-20 v1

摘要

我们探索了如何通过适当地提示大语言模型(LLM)来生成私密合成文本。这解决了医院等机构面临的挑战:它们持有患者医疗记录等敏感文本数据,希望在保护患者隐私的同时共享这些数据,以训练用于医疗任务的机器学习模型。依赖训练或微调模型的方法可能无法实现,原因在于第三方 LLM 的 API 限制,或者出于伦理和法律上禁止与 LLM 本身共享私有数据的考量。我们提出了差分私密关键短语提示播种(Differentially Private Keyphrase Prompt Seeding, DP-KPS),这是一种仅通过私有化提示访问 LLM,从敏感输入语料库生成私密合成文本语料库的方法。该方法基于在提示中播种来自短语嵌入分布的私有样本,从而捕获输入语料库的特征,同时实现必要的输出多样性并保持差分隐私。我们在下游机器学习文本分类任务上评估了 DP-KPS,结果表明其生成的语料库保留了原始语料库的大部分预测能力。我们的研究结果表明,机构有望通过简单的提示和少量计算,在私密共享数据的同时获取机器学习洞察。

关键词

引用

@article{arxiv.2502.13193,
  title  = {Private Text Generation by Seeding Large Language Model Prompts},
  author = {Supriya Nagesh and Justin Y. Chen and Nina Mishra and Tal Wagner},
  journal= {arXiv preprint arXiv:2502.13193},
  year   = {2025}
}