秒级后门:通过模型编辑释放大预训练模型漏洞
人工智能
2024-10-29 v2
摘要
大型预训练模型在广泛的下游任务中取得了显著的成功。然而,近期研究表明,一种类型对抗攻击(即后门攻击)可以通过污染训练数据集来操纵机器学习模型的行为,在大规模预训练模型的实际应用中构成重大威胁,尤其是针对定制化模型。因此,解决针对预训练模型漏洞性研究的独特挑战极其重要。通过对大型预训练模型(如 ViT)进行后门攻击能力的实证研究,我们发现攻击大型预训练模型存在以下独特挑战:1)无法操纵甚至无法访问大型训练数据集,以及2)对训练或微调这些模型所需的计算资源极大。为解决这些挑战,我们在大型预训练模型语境下建立了有效且可行的后门攻击的新标准。遵循这些标准,我们引入了我们的 EDT 模型,即一种高效、无数据、无训练的后门攻击方法。灵感来自模型编辑技术,EDT 将一种基于编辑的轻量级码本注入到大型预训练模型的后门中,用目标图像替换被毒化图像的嵌入,而无需污染训练数据集或训练受害模型。我们的实验在各种预训练模型(包括 ViT、CLIP、BLIP 和 stable diffusion)以及包括图像分类、图像描述和图像生成在内的下游任务上进行,证明了我们方法的有效性。我们的代码已包含在补充材料中。
引用
@article{arxiv.2410.18267,
title = {Backdoor in Seconds: Unlocking Vulnerabilities in Large Pre-trained Models via Model Editing},
author = {Dongliang Guo and Mengxuan Hu and Zihan Guan and Junfeng Guo and Thomas Hartvigsen and Sheng Li},
journal= {arXiv preprint arXiv:2410.18267},
year = {2024}
}