关于代码大语言模型中的 Trojan 签名
密码学与安全
2024-03-08 v2 机器学习
软件工程
摘要
Trojan 签名(由 Fields 等人于 2021 年描述)是指被植入 Trojan 的模型中,被植入 Trojan 类别的参数(权重)与未被植入 Trojan 类别的参数分布之间的显著差异,可用于检测被植入 Trojan 的模型。Fields 等人(2021)在图像模型(如 Resnet、WideResnet、Densenet 和 VGG)的计算机视觉分类任务中发现了 Trojan 签名。在本文中,我们研究了源代码大语言模型分类层参数中的此类签名。我们的结果表明,Trojan 签名可能无法推广到代码大语言模型(LLM)。我们发现,即使在更明确的设置下(冻结预训练权重进行微调)对模型进行投毒,被植入 Trojan 的代码模型仍然表现出顽固性。我们分析了九个被植入 Trojan 的模型,涉及两个二分类任务:克隆检测和缺陷检测。据我们所知,这是第一项检查代码大语言模型基于权重的 Trojan 签名揭示技术的工作,并进一步证明了仅从此类模型的权重中检测 Trojan 是一个难题。
引用
@article{arxiv.2402.16896,
title = {On Trojan Signatures in Large Language Models of Code},
author = {Aftab Hussain and Md Rafiqul Islam Rabin and Mohammad Amin Alipour},
journal= {arXiv preprint arXiv:2402.16896},
year = {2024}
}
备注
This work has been accepted at the International Conference on Learning Representations 2024 Workshop on Secure and Trustworthy Large Language Models, SeT LLM @ ICLR 2024 (Vienna, Austria)