中文

在开源 LLM 上进行微调时请谨慎:您的微调数据可能被窃取!

计算与语言 2026-04-06 v2

摘要

使用专有数据对开源大语言模型 (LLM) 进行微调是面向下游开发者获取任务特定 LLM 的标准做法。令人惊讶的是,我们揭示了一种新颖且令人关注的风险:开源 LLM 的创建者可通过简单的后门训练,从仅访问微调后下游模型的黑盒子中提取私有下游微调数据。我们的全面实验覆盖 4 个主流开源模型(参数规模从 3B 到 32B)和 2 个下游数据集,表明提取性能可相当突出:在实际场景下,最高可提取 76.3% 的下游微调数据(查询),总样本数为 5000;在更理想的场景下,成功率可提升至 94.9%。我们也探讨了基于检测的防御策略,但发现其可被改进的攻击所规避。总体而言,我们凸显了此新发现的数据泄露风险的紧急性,希望更多后续研究能够推动解决此令人关注的风险的进展。我们在实验中使用的代码和数据已发布于 https://github.com/thu-coai/Backdoor-Data-Extraction。

关键词

引用

@article{arxiv.2505.15656,
  title  = {Be Careful When Fine-tuning On Open-Source LLMs: Your Fine-tuning Data Could Be Secretly Stolen!},
  author = {Zhexin Zhang and Yuhao Sun and Junxiao Yang and Shiyao Cui and Yuanchao Zhang and Hongning Wang and Minlie Huang},
  journal= {arXiv preprint arXiv:2505.15656},
  year   = {2026}
}

备注

Accepted to ICLR 2026