轻量且安全:基于轻量 LLM 的安全脚本语言生成
密码学与安全
2026-01-13 v1 编程语言
摘要
PowerShell 等脚本语言的安全性至关重要,因为它们具备强大的自动化和管理功能,常以提升权限运行。目前,保护这些语言仍需要大量人力 effort 来制定和执行规则,对普通管理员造成沉重负担,并可能引发关键生产风险(例如误操作导致服务器宕机)。大型语言模型 (LLM) 在 Python 和 JavaScript 等语言的代码生成、漏洞检测和自动修复方面已显示出强大的能力。然而,它们在帮助生成安全脚本语言代码方面的能力仍 largely 未被探索。本文提出了 SecGenEval-PS,一个系统性评估 LLM 在安全脚本生成、安全分析和自动修复方面能力的基准测试。我们的结果表明,无论是专有模型还是开源模型在这些方面都不足。例如,GPT-4o 和 o3-mini 生成的 PowerShell 脚本中,有超过 60% 是不安全的,需要结构化指导才能实现安全。为弥合这一差距,我们提出了 PSSec 框架,将数据综合与 fine-tuning 结合以增强模型的安全能力。我们开发了一个自调试智能体,将静态分析工具与高级 LLM 的推理能力集成,以合成大规模结构化的三元组:不安全脚本、违规分析和相应修复。我们随后对轻量 LLM(参数量可小至 1.7B)进行监督 fine-tuning (SFT) 和强化学习 (RL),实现安全感知推理和生成安全 PowerShell 代码。在多个 LLM 家族中,包括 GPT 和 Qwen,经过 PSSec 训练的模型在 PowerShell 安全任务上与通用大模型相当或更好,同时将推理成本降低了一个数量级以上。
关键词
引用
@article{arxiv.2601.06419,
title = {Lightweight Yet Secure: Secure Scripting Language Generation via Lightweight LLMs},
author = {Keyang Zhang and Zeyu Chen and Xuan Feng and Dongliang Fang and Yaowen Zheng and Zhi Li and Limin Sun},
journal= {arXiv preprint arXiv:2601.06419},
year = {2026}
}
备注
19 pages,8 figures,conference