中文

面向In-Context学习的数据自适应差分隐私提示合成

密码学与安全 2025-03-04 v2 人工智能 机器学习 机器学习

摘要

大型语言模型(LLM)依赖嵌入在示例/演示中的上下文信息以执行In-Context学习(ICL)。为缓解LLM可能泄露示例中私有信息的风险,我们引入一种新型数据自适应差分隐私算法——AdaDPSyn,通过生成来自私有数据集的合成示例,再使用这些合成示例执行ICL。AdaDPSyn旨在根据数据内在统计特性自适应调整数据合成机制中的噪声水平,从而在保持形式差分隐私保证的同时,维持高ICL准确率。AdaDPSyn的关键创新是精度聚焦的迭代半径缩减技术,该技术根据数据聚类中观察到的模式动态细化聚合半径——即数据分组加噪的范围,从而最小化添加的噪声。我们在标准基准测试上进行大量实验,比较AdaDPSyn与DP few-shot generation算法(Tang等,2023)。实验表明,AdaDPSyn不仅在DP few-shot generation方面表现更佳,还能在接近非私有基线准确率的水平下保持高准确率,为ICL的隐私保护提供了有效解决方案。

关键词

引用

@article{arxiv.2410.12085,
  title  = {Data-adaptive Differentially Private Prompt Synthesis for In-Context Learning},
  author = {Fengyu Gao and Ruida Zhou and Tianhao Wang and Cong Shen and Jing Yang},
  journal= {arXiv preprint arXiv:2410.12085},
  year   = {2025}
}

备注

Accepted to ICLR 2025