中文

TrojFM:针对非常大型基础模型的资源高效后门攻击

密码学与安全 2024-05-28 v1 人工智能 机器学习

摘要

后门攻击针对大型基础模型的一个关键挑战是资源限制。后门攻击通常需要重新训练目标模型,这对非常大的基础模型(如 Llama-3-70B)是不可行的。现有后门攻击主要针对监督分类器或小型基础模型(如 BERT),这些攻击尚未成功攻击非常大的基础模型,尤其是在受限计算资源下更是如此。本文提出了 TrojFM,一种针对非常大型基础模型的新型后门攻击。我们的主要技术贡献是开发一种新型后门注入方法。该方法迫使后门模型在输入相似的隐藏表示,无论其实际语义如何。我们的ethods通过仅微调极小比例的模型参数来注入此类后门。这使得 TrojFM 能够在有限计算资源下,对非常大的基础模型发起高效的、面向下游任务的无监督后门攻击。此外,我们通过定制的 QLoRA 技术优化了微调过程,仅需一块 A100 GPU 即可实现攻击。我们设计了新的触发器注入方法以确保攻击的隐蔽性。通过大量实验,我们首先演示了 TrojFM 能够在不损害正常功能的情况下,对广泛使用的大型 GPT 系列模型发挥有效后门攻击(并在 BERT 系列模型方面超越现有攻击)。此外,我们表明 TrojFM 对最先进的防御措施具有鲁棒性,对关键超参数的变化不敏感。最后,我们进行了资源分析,量化表明该方法在计算和内存成本方面显著优于现有后门攻击。

关键词

引用

@article{arxiv.2405.16783,
  title  = {TrojFM: Resource-efficient Backdoor Attacks against Very Large Foundation Models},
  author = {Yuzhou. Nie and Yanting. Wang and Jinyuan. Jia and Michael J. De Lucia and Nathaniel D. Bastian and Wenbo. Guo and Dawn. Song},
  journal= {arXiv preprint arXiv:2405.16783},
  year   = {2024}
}