中文

Smart-LLaMA:用于智能合约漏洞检测与解释的大语言模型两阶段后训练

密码学与安全 2024-11-12 v1 人工智能 软件工程

摘要

随着区块链技术的快速发展,智能合约安全已成为一项关键挑战。现有的智能合约漏洞检测方法面临三个主要问题:(1)数据集质量不足,缺乏详细解释和精确漏洞位置。(2)大型语言模型(LLM)对智能合约领域的适应性有限,因为大多数LLM在通用文本数据上预训练,而智能合约特定数据极少。(3)缺乏对检测到的漏洞的高质量解释,因为现有方法仅关注检测而不提供清晰解释。这些限制阻碍了检测性能,并使开发者更难理解和快速修复漏洞,可能导致严重的财务损失。为了解决这些问题,我们提出了Smart-LLaMA,一种基于LLaMA语言模型的先进检测方法。首先,我们构建了一个涵盖四种漏洞类型的综合数据集,包含标签、详细解释和精确漏洞位置。其次,我们引入了智能合约特定持续预训练,使用原始智能合约数据使LLM学习智能合约语法和语义,增强其领域适应性。此外,我们提出了解释引导微调,使用成对的有漏洞代码和解释对LLM进行微调,使模型既能检测漏洞又能给出合理解释。我们通过LLM和人类评估来评估解释质量,重点关注正确性、完整性和简洁性。实验结果表明Smart-LLaMA优于最先进基线,F1分数平均提高6.49%,准确率平均提高3.78%,同时提供了可靠的解释。

关键词

引用

@article{arxiv.2411.06221,
  title  = {Smart-LLaMA: Two-Stage Post-Training of Large Language Models for Smart Contract Vulnerability Detection and Explanation},
  author = {Lei Yu and Shiqi Chen and Hang Yuan and Peng Wang and Zhirong Huang and Jingyuan Zhang and Chenjie Shen and Fengjun Zhang and Li Yang and Jiajia Ma},
  journal= {arXiv preprint arXiv:2411.06221},
  year   = {2024}
}