面向安全可解释的智能合约生成:基于安全感知的群组相对策略优化
摘要
智能合约自动化管理高价值资产,其漏洞可能导致灾难性的财务损失。在大型语言模型(Large Language Models, LLMs)中,这一挑战因两种相互关联的失败而被放大:它们作为缺乏透明推理过程的不可审计“黑盒”运行,进而生成充满严重安全漏洞的代码。为解决这两个问题,我们提出了 SmartCoder-R1(基于 Qwen2.5-Coder-7B),一个用于安全可解释智能合约生成的新框架。它首先通过持续预训练(Continual Pre-training, CPT)使模型专业化。随后,我们在 7,998 个经验证的推理与代码样本上应用长思维链监督微调(Long Chain-of-Thought Supervised Fine-Tuning, L-CoT SFT),训练模型模拟人类安全分析。最后,为直接缓解漏洞,我们采用了安全感知群组相对策略优化(Security-Aware Group Relative Policy Optimization, S-GRPO),这是一个强化学习阶段,通过优化针对编译成功、安全合规和格式正确性的加权奖励信号来改进生成策略。在包含 756 个真实世界函数的基准上与 17 个基线进行评估,SmartCoder-R1 确立了新的 state of the art,在五项关键指标上取得最佳表现:ComPass 为 87.70%,VulRate 为 8.60%,SafeAval 为 80.16%,FuncRate 为 53.84%,FullRate 为 50.53%。该 FullRate 相比最强基线 DeepSeek-R1 实现了 45.79% 的相对提升。至关重要的是,其生成的推理在人类评估中也表现出色,在功能性(82.7%)、安全性(85.3%)和清晰度(90.7%)上获得了高质量评分。
关键词
引用
@article{arxiv.2509.09942,
title = {Towards Secure and Explainable Smart Contract Generation with Security-Aware Group Relative Policy Optimization},
author = {Lei Yu and Jingyuan Zhang and Xin Wang and Jiajia Ma and Li Yang and Fengjun Zhang},
journal= {arXiv preprint arXiv:2509.09942},
year = {2025}
}