变形狼不如无牙虎:基于用户行为的自适应恶意代码注入后门攻击
人工智能
2024-08-21 v1
摘要
近年来,大型语言模型(LLM)在代码生成领域取得了显著进展。然而,随着用户越来越多地依赖这些模型进行软件开发,与代码生成模型相关的安全风险也日益突出。研究表明,传统的深度学习鲁棒性问题也会负面影响代码生成领域。本文首先提出一个聚焦代码生成场景安全问题的博弈论模型。该框架概述了攻击者可能在何处及如何传播恶意代码模型以创建安全威胁的可能情景和模式。我们还首次指出,攻击者可以利用后门攻击动态调整恶意代码注入的时机,从而根据用户的技能水平释放不同程度的恶意代码。通过对领先代码生成模型进行大量实验,我们验证了我们提出的博弈论模型,并突出了这些新型攻击情景对确保代码模型安全使用的显著威胁。
引用
@article{arxiv.2408.10334,
title = {A Disguised Wolf Is More Harmful Than a Toothless Tiger: Adaptive Malicious Code Injection Backdoor Attack Leveraging User Behavior as Triggers},
author = {Shangxi Wu and Jitao Sang},
journal= {arXiv preprint arXiv:2408.10334},
year = {2024}
}