超越隐私攻击中的梯度与先验:在联邦学习中利用语言模型的池化层输入
机器学习
2024-03-19 v4 人工智能
计算与语言
密码学与安全
摘要
通过联邦学习(FL)训练的语言模型在处理复杂任务的同时保护用户隐私方面展现出了令人印象深刻的能力。最近的研究表明,利用梯度信息和先验知识有可能揭示 FL 环境中的训练样本。然而,这些研究忽略了与模型内在架构相关的潜在隐私风险。本文提出了一种两阶段隐私攻击策略,针对当代语言模型架构中的漏洞,通过初步恢复特定特征方向作为额外监督信号,显著提升了攻击性能。我们的对比实验在各种数据集和场景中展现了卓越的攻击性能,突显了与日益复杂的语言模型架构相关的隐私泄露风险。我们呼吁社区在大型语言模型设计中认识并解决这些潜在的隐私风险。
引用
@article{arxiv.2312.05720,
title = {Beyond Gradient and Priors in Privacy Attacks: Leveraging Pooler Layer Inputs of Language Models in Federated Learning},
author = {Jianwei Li and Sheng Liu and Qi Lei},
journal= {arXiv preprint arXiv:2312.05720},
year = {2024}
}