中文

面向代码变异的 LLM 微调:网络威胁的新纪元

密码学与安全 2024-10-30 v1 软件工程

摘要

大语言模型(LLM)在自然语言处理和代码合成方面的最新进展显著提升了其能力,使得跨领域的更复杂应用成为可能。本文探讨了 LLM 在代码变异(code mutation)背景下的应用,该过程在不改变程序功能的前提下改变其代码结构。传统上,代码变异被用于提高关键任务应用中的软件鲁棒性。此外,变异引擎也被恶意软件开发者利用,以规避恶意软件检测系统所采用的基于签名的检测方法。此类威胁行为者常用的现有代码变异引擎通常只会导致恶意软件产生有限的变化,这些变化仍可通过静态代码分析识别。然而,基于 LLM 的代码合成器所展现的灵活性,通过允许更复杂的、不易被静态分析检测到的代码变异,可能会显著改变这一威胁格局。可以通过微调和再训练来增加预训练 LLM 合成的代码的变异性。我们将这个过程称为代码变异训练。在本文中,我们为基于预训练 LLM 的代码合成器提出了一个新颖的代码变异训练定义,并在一个轻量级预训练模型上演示了这种训练。我们的方法涉及在子程序级别重构(即变异)代码,这允许进行更易管理的变异,同时通过单元测试验证保持语义完整性。我们的实验结果说明了我们的方法在提高基于 LLM 的程序合成器的代码变异能力方面的有效性,能够生成多样化且功能正确的代码解决方案,展示了它们改变代码变异格局及其相关威胁的潜力。

关键词

引用

@article{arxiv.2410.22293,
  title  = {Fine-Tuning LLMs for Code Mutation: A New Era of Cyber Threats},
  author = {Mohammad Setak and Pooria Madani},
  journal= {arXiv preprint arXiv:2410.22293},
  year   = {2024}
}