中文

通过层级学习率衰减微调缓解数据外泄攻击

机器学习 2025-09-03 v1

摘要

数据湖允许在敏感、高价值的医疗数据集上训练强大的机器学习模型,但也引入了由于潜在泄露受保护健康信息而导致的严重隐私风险。最近的研究表明,敌人可以通过将潜在表示嵌入模型参数或通过多任务学习诱导记忆来窃取训练数据。这些攻击自称为良好的实用模型,却能够重建高保真医疗图像,构成严重的隐私威胁,具有法律和伦理影响。本文我们提出一种简单而有效的缓解策略,通过在导出时使用衰减的层级学习率进行微调来扰乱嵌入数据,而不会降低任务性能。在 DermaMNIST、ChestMNIST 和 MIMIC-CXR 上的评估显示,我们的方法保持了实用任务性能,有效干扰了最先进的外泄攻击,超越了先前的防御措施,并使外泄数据对训练无用。对自适应攻击的消融实验和讨论凸显了挑战和未来方向。我们的发现为数据湖训练的模型和集中式联邦学习中的数据泄漏提供了实用的防御。

关键词

引用

@article{arxiv.2509.00027,
  title  = {Mitigating Data Exfiltration Attacks through Layer-Wise Learning Rate Decay Fine-Tuning},
  author = {Elie Thellier and Huiyu Li and Nicholas Ayache and Hervé Delingette},
  journal= {arXiv preprint arXiv:2509.00027},
  year   = {2025}
}