关注触发器:构建可扎根于蒸馏的后门
机器学习
2025-10-22 v1 人工智能
密码学与安全
摘要
大型语言模型(LLM)常被下游用户用作知识蒸馏的教师模型,将其能力压缩到内存高效模型中。然而,由于教师模型可能来自不可信方,蒸馏可能引发意想不到的安全风险。本文调查了从后门教师模型进行知识蒸馏的安全影响。首先,我们表明以往的后门大多不 transfer 到学生模型。我们的关键洞察在于,现有的 LLM 后门方法选择的触发器标记在常规语境中很少出现。这低估了知识蒸馏的安全风险,我们提出一种新的后门技术,即 T-MTB,使我们能够构建和研究可 transfer 的后门。T-MTB 精心构建一个由几个在预期蒸馏数据集中个体经常出现的特定标记组成的复合后门触发器。如此一来,受毒化的教师模型仍保持隐蔽性,而在蒸馏过程中,这些标记的单个存在为后门 transfer 到学生模型提供了足够的信号。使用 T-MTB,我们在两个攻击场景(jailbreaking 和内容调制)以及四种 LLM 模型族中 demonstration 和广泛研究了可 transfer 后门的安全风险。
引用
@article{arxiv.2510.18541,
title = {Pay Attention to the Triggers: Constructing Backdoors That Survive Distillation},
author = {Giovanni De Muri and Mark Vero and Robin Staab and Martin Vechev},
journal= {arXiv preprint arXiv:2510.18541},
year = {2025}
}