面向In-Context学习的数据自适应差分隐私提示合成
密码学与安全
2025-03-04 v2 人工智能
机器学习
机器学习
摘要
大型语言模型(LLM)依赖嵌入在示例/演示中的上下文信息以执行In-Context学习(ICL)。为缓解LLM可能泄露示例中私有信息的风险,我们引入一种新型数据自适应差分隐私算法——AdaDPSyn,通过生成来自私有数据集的合成示例,再使用这些合成示例执行ICL。AdaDPSyn旨在根据数据内在统计特性自适应调整数据合成机制中的噪声水平,从而在保持形式差分隐私保证的同时,维持高ICL准确率。AdaDPSyn的关键创新是精度聚焦的迭代半径缩减技术,该技术根据数据聚类中观察到的模式动态细化聚合半径——即数据分组加噪的范围,从而最小化添加的噪声。我们在标准基准测试上进行大量实验,比较AdaDPSyn与DP few-shot generation算法(Tang等,2023)。实验表明,AdaDPSyn不仅在DP few-shot generation方面表现更佳,还能在接近非私有基线准确率的水平下保持高准确率,为ICL的隐私保护提供了有效解决方案。
关键词
引用
@article{arxiv.2410.12085,
title = {Data-adaptive Differentially Private Prompt Synthesis for In-Context Learning},
author = {Fengyu Gao and Ruida Zhou and Tianhao Wang and Cong Shen and Jing Yang},
journal= {arXiv preprint arXiv:2410.12085},
year = {2025}
}
备注
Accepted to ICLR 2025