使用差分隐私语言模型为隐私保护深度检索系统生成合成查询
计算与语言
2024-05-24 v3 密码学与安全
信息检索
摘要
我们解决了在训练深度检索系统时确保差分隐私(DP)保证的挑战。训练这些系统通常涉及对比式损失的使用,这类损失通常不可按样本分解,因此难以直接进行DP训练,因为常用技术需要逐样本梯度。为解决此问题,我们提出了一种方法,优先在训练深度检索系统之前确保查询隐私。我们的方法采用DP语言模型(LM)来生成代表原始数据的私有合成查询。这些合成查询可用于下游检索系统训练而不损害隐私。与直接DP训练相比,我们的方法在保持查询级隐私保证的同时显著提升了检索质量。本工作凸显了利用LM克服标准DP训练方法局限性的潜力。
引用
@article{arxiv.2305.05973,
title = {Synthetic Query Generation for Privacy-Preserving Deep Retrieval Systems using Differentially Private Language Models},
author = {Aldo Gael Carranza and Rezsa Farahani and Natalia Ponomareva and Alex Kurakin and Matthew Jagielski and Milad Nasr},
journal= {arXiv preprint arXiv:2305.05973},
year = {2024}
}
备注
Accepted to NAACL 2024