中文

Provably Protecting Fine-Tuned LLMs from Training Data Extraction while Preserving Utility

机器学习 2026-05-22 v2

摘要

在敏感数据集上对大语言模型(LLM)进行微调会引发隐私顾虑,因为训练数据提取(TDE)攻击可能暴露高度机密信息。现有防御手段要么缺乏形式化隐私保证,要么导致显著的实用性下降。我们观察到微调会引发广泛的概率偏移,但仅需保留一小部分有影响力的 token 级偏差;其余偏移可通过最小化效用影响进行激进平滑处理。基于此洞察,我们提出 SCP-Δr\Delta_r——一种基于近访问无关性(NAF)的算法,针对相对概率运作,显式平滑低影响 token。SCP-Δr\Delta_r 在理论上优于现有基于 NAF 的方法实现数量级提升的理论上界,并在保持最小性能损失的同时,对抗 TDE 攻击提供强有力的经验防御。

关键词

引用

@article{arxiv.2602.00688,
  title  = {Provably Protecting Fine-Tuned LLMs from Training Data Extraction while Preserving Utility},
  author = {Tom Segal and Asaf Shabtai and Yuval Elovici},
  journal= {arXiv preprint arXiv:2602.00688},
  year   = {2026}
}

备注

21 pages, 5 figures