去中心化训练中大型语言模型训练数据通过激活反转攻击窃取
密码学与安全
2025-02-25 v1
摘要
去中心化训练已成为 democratize 大型语言模型(LLM)训练的高效框架,但由于潜在包含敏感数据的训练数据集,其隐私风险尚未得到探索。本文识别出一种新型且切实可行的攻击面:去中心化训练中训练数据的隐私泄露,并首次提出了激活反转攻击(AIA)。AIA首先构建由文本标签及其对应激活构成的影子数据集。利用该数据集,攻击模型可从受害者去中心化训练中的激活中重建训练数据。我们在各种LLM和公开可用数据集上进行大规模实验,表明去中心化训练易受AIA攻击。这些发现凸显了在去中心化训练中增强安全措施以缓解LLM训练中隐私风险的紧迫性。
引用
@article{arxiv.2502.16086,
title = {Stealing Training Data from Large Language Models in Decentralized Training through Activation Inversion Attack},
author = {Chenxi Dai and Lin Lu and Pan Zhou},
journal= {arXiv preprint arXiv:2502.16086},
year = {2025}
}
备注
12 pages, 5 figures