基于遮挡的代码大语言模型木马触发输入检测
软件工程
2023-12-12 v2
摘要
大语言模型(LLM)正成为软件开发不可或缺的一部分。这些模型在庞大的代码数据集上训练,难以验证每个数据点。因此,一种潜在的攻击面是向训练数据中注入有毒数据,使模型变得脆弱,即被植入木马。这种攻击通过在模型内部隐藏操纵行为,导致下游任务中模型完整性受损,从而构成重大威胁。本文提出了一种基于遮挡的人在回路技术 OSeql,用于区分代码的木马触发输入。该技术基于以下观察:被植入木马的代码神经模型严重依赖输入的触发部分;因此,移除该部分将大幅改变模型对其预测的置信度。我们的结果表明,OSeql 能够以近乎 100% 的召回率检测触发输入。我们讨论了假阳性问题及其解决方法。这些结果为该领域的未来研究提供了基线。
引用
@article{arxiv.2312.04004,
title = {Occlusion-based Detection of Trojan-triggering Inputs in Large Language Models of Code},
author = {Aftab Hussain and Md Rafiqul Islam Rabin and Toufique Ahmed and Mohammad Amin Alipour and Bowen Xu},
journal= {arXiv preprint arXiv:2312.04004},
year = {2023}
}