中文

揭示基于分割框架的大语言模型私有微调漏洞:双向增强攻击

密码学与安全 2024-12-11 v2

摘要

近期大型预训练语言模型(LLM)的快速发展显著推动了多个领域的应用。针对特定任务微调模型通常需要使用私有、领域特定的数据进行微调(FT),但隐私顾虑使此类数据难以公开,且大规模 LLM 的部署计算需求对资源受限的数据持有者构成挑战。这催生了分割学习(SL)——一种模型即服务(MaaS)范式——通过将 LLM 划分为更小的子模块进行分布式训练与部署,仅传输中间激活值而非原始数据,从而兼顾用户数据隐私、模型所有权及资源限制。尽管 SL 声称具备隐私保护优势,本文揭示了 SL 与 LLM-FT 结合后存在显著漏洞:微调的“距离不远”特性及 LLM 的自回归特性。我们提出了双向半白盒重建(BiSR)——首个针对 SL 前向与反向传播过程的私有数据重建攻击。BiSR 利用预训练权重作为先验知识,融合基于学习的攻击与双向优化方法,实现高效数据重建;同时引入噪声自适应专家混合模型(NaMoE)提升重建鲁棒性。我们在多种主流 LLM 上进行系统实验,实证表明 BiSR 达到最先进性能。此外,本文全面评估了三类典型防御机制,证明即便面对这些防御,BiSR 仍能成功重建私有数据。

关键词

引用

@article{arxiv.2409.00960,
  title  = {Unveiling the Vulnerability of Private Fine-Tuning in Split-Based Frameworks for Large Language Models: A Bidirectionally Enhanced Attack},
  author = {Guanzhong Chen and Zhenghan Qin and Mingxin Yang and Yajie Zhou and Tao Fan and Tianyu Du and Zenglin Xu},
  journal= {arXiv preprint arXiv:2409.00960},
  year   = {2024}
}

备注

ACM Conference on Computer and Communications Security 2024 (CCS 24)