Detect Llama:利用大型语言模型发现智能合约中的漏洞
密码学与安全
2024-07-17 v1
摘要
在本文中,我们检验了一个假设:尽管OpenAI的GPT-4总体表现良好,但我们可以微调开源模型,使其在智能合约漏洞检测方面超越GPT-4。我们基于Meta的Code Llama和包含17k提示的数据集微调了两个模型:Detect Llama - Foundation和Detect Llama - Instruct,同时还微调了OpenAI的GPT-3.5 Turbo模型(GPT-3.5FT)。然后,我们在我们开发的测试集上,针对GPT-4和GPT-4 Turbo,评估这些模型以及一个随机基线,检测数据集中八种漏洞以及识别出的前两种主要漏洞——及其加权F1分数。我们发现,对于二分类(即,这个智能合约是否有漏洞?),我们表现最好的两个模型GPT-3.5FT和Detect Llama - Foundation,其F1分数分别达到0.776和0.68,优于GPT-4(0.66)和GPT-4 Turbo(0.675)。在针对单个漏洞识别的评估中,我们的前两个模型GPT-3.5FT和Detect Llama - Foundation,在全部漏洞的加权F1分数(分别为0.61和0.56,而GPT-4为0.218,GPT-4 Turbo为0.243)以及前两个主要识别漏洞的加权F1分数(GPT-3.5FT为0.719,Detect Llama - Foundation为0.674,而GPT-4为0.363,GPT-4 Turbo为0.429)上,均显著优于GPT-4和GPT-4 Turbo。
引用
@article{arxiv.2407.08969,
title = {Detect Llama -- Finding Vulnerabilities in Smart Contracts using Large Language Models},
author = {Peter Ince and Xiapu Luo and Jiangshan Yu and Joseph K. Liu and Xiaoning Du},
journal= {arXiv preprint arXiv:2407.08969},
year = {2024}
}