中文

模型供应链投毒:基于嵌入不可区分性的预训练模型后门攻击

密码学与安全 2025-02-05 v3 计算机视觉与模式识别 机器学习

摘要

预训练模型(PTMs)在机器学习供应链的各类下游任务中被广泛采用。采用不可信的 PTMs 会引入重大安全风险,攻击者可通过在 PTMs 中植入隐藏的恶意行为(后门)来投毒模型供应链。然而,现有的针对 PTMs 的后门攻击仅能实现部分任务无关性,且植入的后门在微调过程中极易被擦除。这使得后门难以在供应链中持久存留并传播。本文提出了一种新颖且更严重的后门攻击 TransTroj,它使植入 PTMs 的后门能够在模型供应链中高效转移。具体而言,我们首先将该攻击形式化为嵌入空间中中毒样本与干净样本之间的不可区分性问题。我们将嵌入不可区分性分解为攻击前不可区分性和攻击后不可区分性,分别表示攻击前后中毒嵌入与参考嵌入的相似性。然后,我们提出了一种两阶段优化方法,分别优化触发器和受害 PTMs 以实现嵌入不可区分性。我们在四个 PTMs 和六个下游任务上评估了 TransTroj。实验结果表明,我们的方法显著优于 SOTA 任务无关后门攻击——在大多数下游任务上实现了近 100% 的攻击成功率——并在各种系统设置下表现出鲁棒性。我们的发现强调,迫切需要保护模型供应链免受此类可转移后门攻击。代码可在 https://github.com/haowang-cqu/TransTroj 获取。

关键词

引用

@article{arxiv.2401.15883,
  title  = {Model Supply Chain Poisoning: Backdooring Pre-trained Models via Embedding Indistinguishability},
  author = {Hao Wang and Shangwei Guo and Jialing He and Hangcheng Liu and Tianwei Zhang and Tao Xiang},
  journal= {arXiv preprint arXiv:2401.15883},
  year   = {2025}
}

备注

ACM Web Conference 2025 (Oral)