中文

最小提示扰动导致代码漏洞:编码 LLM 中的提示脆弱性与隐藏状态信号

密码学与安全 2026-05-29 v1 计算与语言 软件工程

摘要

基于 LLM 的编码助手正在迎来快速采纳,为开发者生产力带来了实质性提升。随着组织越来越多地交付这些智能体生成的代码,代码的安全性变得至关重要。先前的研究表明,轻微的提示扰动会降低 LLM 生成代码的功能正确性,但它们是否也会损害代码安全性尚未得到研究。我们对提示进行基于 token 的变异,涵盖三种模型和五种编程语言,展示即使是仅单个字符的变异,也会使生成的代码从安全变为脆弱。通过探测模型的隐藏状态发现,这种脆弱性部分编码在提示表示中,但呈不均匀分布。输入处理漏洞(模型未包含验证或清理)比安全默认漏洞(不安全代码源于如弱算法或不安全参数等局部选择)更易预测(平均 AUC 为 0.753),后者的平均 AUC 为 0.674。这些结果表明,LLM 辅助编码的威胁模型 extends beyond 提示注入到普通提示变异,并指出输入处理漏洞可在生成前被捕获,而安全默认漏洞需要在解码期间进行干预。

关键词

引用

@article{arxiv.2605.29737,
  title  = {Minimal Prompt Perturbations Lead to Code Vulnerabilities: Prompt Fragility and Hidden-State Signals in Coding LLMs},
  author = {Alexander Sternfeld and Andrei Kucharavy and Ljiljana Dolamic},
  journal= {arXiv preprint arXiv:2605.29737},
  year   = {2026}
}