烟雾与镜像:通过隐式恶意提示越狱 LLM 基于代码的生成
软件工程
2025-03-25 v1
摘要
大型语言模型 (LLM) 的兴起彻底改变了自然语言处理领域,并显著影响了代码生成任务,提高了软件开发的效率和生产力。值得注意的是,像 GPT-4 这样的 LLM 在文本到代码生成任务中显示出惊人的能力。然而,日益依赖 LLM 进行代码生成 necessitates 对其输出的安全性进行关键检视。现有研究主要聚焦于验证 LLM 的功能正确性,忽略了其代码生成中的安全性。本文引入一种越狱方法 CodeJailbreaker,用于揭示 LLM 基于代码生成中的安全问题。基本观察是,现有的 LLM 安全机制是通过指令遵循范例构建的,其中恶意意图在提示的指令中被明确表达。因此,CodeJailbreaker 探索构建一个指令良好且恶意意图被编码在隐秘信道(即提交消息)中的提示,以规避安全机制。在最近发布的 RMCBench 基准测试上进行实验,表明 CodeJailbreaker 在三个代码生成任务中的攻击效果显著优于传统越狱策略,后者在指令中显式传达恶意意图。该研究挑战了 LLM 基于代码生成中的传统安全范式,强调在保护免受隐式恶意线索的威胁方面需要更加完善的安全措施。
引用
@article{arxiv.2503.17953,
title = {Smoke and Mirrors: Jailbreaking LLM-based Code Generation via Implicit Malicious Prompts},
author = {Sheng Ouyang and Yihao Qin and Bo Lin and Liqian Chen and Xiaoguang Mao and Shangwen Wang},
journal= {arXiv preprint arXiv:2503.17953},
year = {2025}
}