中文

GenSIaC:利用大型语言模型生成面向安全的基础设施即代码

密码学与安全 2025-11-18 v1 软件工程

摘要

近年来,基础设施即代码(IaC)已成为通过代码和自动化来管理和配置 IT 基础设施的关键方法。IaC 使组织能够创建可扩展且一致的环境,有效地管理服务器和开发设置。然而,随着云基础设施复杂性的增加,IaC 脚本中误配置和安全漏洞的风险不断增加。为此,本文调查了大型语言模型(LLM)在生成面向安全的 IaC 代码方面的潜力,以避免开发人员和管理员引入的误配置。尽管 LLM 在自然语言处理和代码生成方面取得了显著进展,但其生成安全 IaC 脚本的能力尚不明确。本文解决两个主要问题:1) LLM 生成的 IaC 脚本缺乏对安全弱点的理解,2)缺乏增强 LLM 生成 IaC 代码安全性的技术。为评估 LLM 是否包含安全知识,我们首先对基础 LLM 在生成和检查 IaC 代码时识别主要 IaC 安全弱点的能力进行全面评估。然后,我们提出了 GenSIaC,一个旨在提高 LLM 识别潜在安全弱点能力的指令微调数据集。利用 GenSIaC,我们对 LLM 进行微调并指示模型生成面向安全的 IaC 代码。我们的评估显示,我们的模型在识别和防止 IaC 安全误配置方面实现了显著提升,例如将 F1 分数从 0.303 提升到 0.858。此外,我们进行了消融研究并探讨了 GenSIaC 对其他 LLM 的通用性及其跨语言能力。

关键词

引用

@article{arxiv.2511.12385,
  title  = {GenSIaC: Toward Security-Aware Infrastructure-as-Code Generation with Large Language Models},
  author = {Yikun Li and Matteo Grella and Daniel Nahmias and Gal Engelberg and Dan Klein and Giancarlo Guizzardi and Thijs van Ede and Andrea Continella},
  journal= {arXiv preprint arXiv:2511.12385},
  year   = {2025}
}