中文

探究检索增强代码生成中知识库投毒的安全威胁

密码学与安全 2025-02-06 v1 软件工程

摘要

大型语言模型(LLMs)在软件开发中的集成,特别是通过使用检索增强代码生成(RACG)系统来利用外部知识库的信息增强代码生成,已彻底改变了该领域。然而,RACG系统的安全影响,尤其是知识库中易受攻击的代码示例所带来的风险,在很大程度上仍未得到探索。鉴于通常作为RACG系统知识库收集来源的公共代码仓库通常对社区中的任何人都是可访问的,这一风险尤其令人担忧。恶意攻击者可以利用这种可访问性将易受攻击的代码注入知识库,使其变得有毒。一旦这些被投毒的样本被检索并整合到生成的代码中,它们就可能将安全漏洞传播到最终产品中。本文首次对RACG系统相关的安全风险进行了全面研究,重点关注知识库中的易受攻击代码如何危及生成代码的安全性。我们通过使用四个主要LLM、两个检索器和两种投毒场景进行广泛实验,研究了不同设置下LLM生成代码的安全性。我们的发现突显了知识库投毒的重大威胁,即使是一个被投毒的代码示例也可能危及高达48%的生成代码。我们的发现为RACG系统中的漏洞引入提供了关键见解,并提供了实用的缓解建议,从而有助于在未来的工作中提高LLM生成代码的安全性。

关键词

引用

@article{arxiv.2502.03233,
  title  = {Exploring the Security Threats of Knowledge Base Poisoning in Retrieval-Augmented Code Generation},
  author = {Bo Lin and Shangwen Wang and Liqian Chen and Xiaoguang Mao},
  journal= {arXiv preprint arXiv:2502.03233},
  year   = {2025}
}