中文

DOGe:防御性输出生成以保护 LLM 免受知识蒸馏

机器学习 2025-10-21 v2 人工智能 计算与语言

摘要

大型语言模型(LLM)代表着大量的智力和经济投资,然而其有效性可能会在无意中通过知识蒸馏(KD)促进模型模仿。在实际场景中,竞争对手只需观察公开可访问的输出,即可蒸馏专有 LLM 的能力,这类似于仅通过观察来逆向工程一项复杂的性能表现。现有的保护方法(如水印)只能在事后识别模仿,而其他防御方法则假设学生模型模仿教师模型的内部 logits,这使得它们在面对仅从观察到的输出文本进行的蒸馏时无能为力。本文直面了在基于 API 访问的现实约束下主动保护 LLM 的挑战。我们引入了一种有效且高效的防御性输出生成(DOGe)策略,该策略巧妙地修改了 LLM 的输出行为。其输出对合法用户是准确且有用的,但被设计为对蒸馏具有误导性,从而显著破坏模仿企图。我们通过仅使用对抗损失微调教师 LLM 的最终线性层来实现这一点。这种针对性的训练方法能够在推理期间预判并破坏蒸馏企图。我们的实验表明,在保持教师模型性能的同时,从防御性生成的输出中蒸馏出的学生模型表现出灾难性的性能下降,证明 DOGe 是一种针对基于 KD 的模型模仿的实用防护措施。

关键词

引用

@article{arxiv.2505.19504,
  title  = {DOGe: Defensive Output Generation for LLM Protection Against Knowledge Distillation},
  author = {Pingzhi Li and Zhen Tan and Mohan Zhang and Huaizhi Qu and Huan Liu and Tianlong Chen},
  journal= {arXiv preprint arXiv:2505.19504},
  year   = {2025}
}

备注

Code is available at https://github.com/unites-lab/doge