中文

通过深度低秩残差蒸馏锁定预训练权重

机器学习 2026-05-12 v1

摘要

近年来,开放权重语言模型的质量得到了显著提升。共享权重极大地促进了模型在 diverse hardware 和 software 平台上的采用。它们还允许更开放的研究和测试,用户可以将其用作检查点,根据需要进行微调,甚至可能重新分发。在某些情况下,对于修改这些权重以进行未授权用途的担忧可能超过提供此类自由度的优势。防御此类适应性攻击并不容易:由于适应性攻击者默认可以观察所有权重和架构,他们可以逆转简单的结构防御,并使用优化来击败最简单的锁定机制。本文中,我们利用自动微分的推理-训练不对称性作为一种新型防御轴线。我们提出DLR-Lock方法,该方法让模型制造商将模型中每个预训练的MLP替换为参数数量相当的深度低秩残差网络(DLR-Net),迫使在反向传播期间产生线性随深度增长的激活内存。DLR-Net通过模块级蒸馏进行高效训练。我们表明,除了这种内存开销之外,DLR-Lock还导致架构不匹配,这些不匹配使标准微调的优化景观变得复杂,并且反向传递的开销远大于前向传递。我们的防御在保持原始模型能力的同时,成功抵御了具有防御策略完全知识的适应性攻击者。实验在LLM上验证了这些声明。

关键词

引用

@article{arxiv.2605.10777,
  title  = {Locking Pretrained Weights via Deep Low-Rank Residual Distillation},
  author = {Keitaro Sakamoto and Pierre Ablin and Federico Danieli and Marco Cuturi},
  journal= {arXiv preprint arXiv:2605.10777},
  year   = {2026}
}