中文

Mind the Privacy Unit! 用户级差分隐私语言模型微调

计算与语言 2024-08-19 v3 密码学与安全 机器学习

摘要

大型语言模型 (LLMs) 已成为解决跨多样化领域复杂任务的强大工具,但在基于敏感数据微调时也引发隐私担忧,由于可能导致记忆。虽然差分隐私 (DP) 提供了通过确保模型\'在任何特定隐私单元存在或不存在时几乎不可区分\'的有力解决方案,但当前对 LLMs 的评估大多将每个示例(文本记录)作为隐私单元。这导致在贡献数目不同的用户之间隐私保证不均。因此,我们聚焦于用户级 DP,以满足需要确保用户间统一隐私保护的应用场景。我们系统评估了用于 LLM 微调的自然语言生成任务的用户级差分隐私。聚焦于实现用户级差分隐私保证的两种机制,Group Privacy 和 User-wise DP-SGD,我们研究了数据选择策略和参数调优等设计选择,以实现最佳的隐私-实用性权衡。

关键词

引用

@article{arxiv.2406.14322,
  title  = {Mind the Privacy Unit! User-Level Differential Privacy for Language Model Fine-Tuning},
  author = {Lynn Chua and Badih Ghazi and Yangsibo Huang and Pritish Kamath and Ravi Kumar and Daogao Liu and Pasin Manurangsi and Amer Sinha and Chiyuan Zhang},
  journal= {arXiv preprint arXiv:2406.14322},
  year   = {2024}
}

备注

Published as a conference paper at COLM 2024