Provably Protecting Fine-Tuned LLMs from Training Data Extraction while Preserving Utility
机器学习
2026-05-22 v2
摘要
在敏感数据集上对大语言模型(LLM)进行微调会引发隐私顾虑,因为训练数据提取(TDE)攻击可能暴露高度机密信息。现有防御手段要么缺乏形式化隐私保证,要么导致显著的实用性下降。我们观察到微调会引发广泛的概率偏移,但仅需保留一小部分有影响力的 token 级偏差;其余偏移可通过最小化效用影响进行激进平滑处理。基于此洞察,我们提出 SCP-——一种基于近访问无关性(NAF)的算法,针对相对概率运作,显式平滑低影响 token。SCP- 在理论上优于现有基于 NAF 的方法实现数量级提升的理论上界,并在保持最小性能损失的同时,对抗 TDE 攻击提供强有力的经验防御。
引用
@article{arxiv.2602.00688,
title = {Provably Protecting Fine-Tuned LLMs from Training Data Extraction while Preserving Utility},
author = {Tom Segal and Asaf Shabtai and Yuval Elovici},
journal= {arXiv preprint arXiv:2602.00688},
year = {2026}
}
备注
21 pages, 5 figures