揭示实用语言模型训练中的梯度反向风险
机器学习
2025-07-30 v1 人工智能
摘要
梯度反向攻击已被证明是联邦学习(FL)中重要的隐私威胁,尤其是在视觉模型等连续领域。相比之下,在应用于语言模型时,由于文本数据中标记离散性带来的挑战,人们常认为其效果较差或高度依赖不切实际的训练设置。因此,尽管 FL 作为语言模型的新兴训练方法,其潜在隐私威胁仍大体未被充分评估。本文提出一种名为 Grab 的领域特定梯度反向攻击(梯度反向混合优化)。Grab 特点是两个交替优化过程,以应对实际训练设置带来的挑战,包括针对不同层的 dropout 掩码进行同步优化以提高标记恢复,以及针对有效标记序列的离散优化。Grab 能够恢复大部分私有训练数据(最高达 92.9% 的恢复率),在基准设置下比仅使用辅助模型进行离散优化的攻击策略提升了最高达 28.9% 的恢复率,在实际设置下提升了最高达 48.5% 的恢复率。Grab 为理解语言模型新兴 FL 训练模式中的这一隐私威胁提供了重要一步。
引用
@article{arxiv.2507.21198,
title = {Uncovering Gradient Inversion Risks in Practical Language Model Training},
author = {Xinguo Feng and Zhongkui Ma and Zihan Wang and Eu Joe Chegne and Mengyao Ma and Alsharif Abuadbba and Guangdong Bai},
journal= {arXiv preprint arXiv:2507.21198},
year = {2025}
}
备注
15 Pages, 5 figures, 10 tables. Accepted by ACM CCS 2024