中文

TrojanedCM:一个被植入木马的代码大语言模型仓库

软件工程 2023-12-13 v2

摘要

随着源代码深度神经网络模型木马化研究的快速增长,我们观察到亟需开发用于测试各类木马检测与遗忘技术的基准木马模型。本工作中,我们旨在为科学界提供多样的木马化代码模型,涵盖多种最先进架构,以便其检验此类技术。因此我们提出TrojanedCM,一个公开可用的干净与投毒源代码模型仓库。我们为两项代码分类任务(缺陷检测与克隆检测)和一项代码生成任务(文本到代码生成)提供投毒模型。我们在上述任务由基准数据集(Devign、BigCloneBench、CONCODE)生成的投毒数据集上,微调了CodeBERT、PLBART、CodeT5、CodeT5+等流行预训练代码模型。该仓库还提供模型架构与参数的完全访问权限,使从业者能够研究不同的白盒分析技术。除投毒模型外,我们还提供一个投毒框架,从业者可借此为不同任务和代码模型部署多种投毒策略。所有资料可通过此链接获取:https://github.com/UH-SERG/TrojanedCM。

关键词

引用

@article{arxiv.2311.14850,
  title  = {TrojanedCM: A Repository of Trojaned Large Language Models of Code},
  author = {Aftab Hussain and Md Rafiqul Islam Rabin and Mohammad Amin Alipour},
  journal= {arXiv preprint arXiv:2311.14850},
  year   = {2023}
}