通过防御感知的架构后门利用大型语言模型漏洞
密码学与安全
2024-09-10 v2 人工智能
硬件体系结构
摘要
深度神经网络 (DNN) 长期以来被认识为易受后门攻击的威胁。通过在微调过程中提供中毒的训练数据,攻击者可以在受害模型中植入后门,从而使满足特定文本触发模式的输入样本被分类为攻击者选择的目标标签。虽然计算机视觉和自然语言处理 (NLP) 领域已广泛探索基于黑盒攻击的后门,但依赖于白盒攻击哲学的后门研究仍鲜有彻底调查。本文是首次引入一种潜伏于底层模型架构中的新型后门攻击。具体而言,我们提出设计独立的后门模块,包含两个功能:触发器检测和噪声注入。模型架构层的可添加模块可检测输入触发器标记的存在,并通过高斯噪声修改层权重,以扰乱基线模型的特征分布。我们在两个模型架构设置下对五个大型语言数据集进行了广泛实验,以评估我们的攻击方法。我们展示了在大型语言模型上实现的训练自由的架构后门确实构成真实威胁。不同于现有工作,它能够存活严格的微调和重新训练过程,同时能规避基于输出概率的防御方法(如 BDDR)。所有代码和数据均可在 https://github.com/SiSL-URI/Arch_Backdoor_LLM 获取。
引用
@article{arxiv.2409.01952,
title = {Exploiting the Vulnerability of Large Language Models via Defense-Aware Architectural Backdoor},
author = {Abdullah Arafat Miah and Yu Bi},
journal= {arXiv preprint arXiv:2409.01952},
year = {2024}
}